
前几天在一个机器人创业者的群里有人问了个特别典型的问题想给配送机器人加端侧大模型对话功能需要买什么显卡群里的回答出奇一致——先别急着买显卡去看看英伟达刚发布的78 TOPS机器人芯片。这一句话点出了眼下机器人圈两个最热的话题端侧算力已经卷到TOPS级别同时专用机器人芯片正在取代通用显卡成为主流选择。英伟达这次放出的新芯片最抓人的两个数字是算力翻倍和功耗降40%。从纸面看78 TOPS在边缘AI芯片里并不是最夸张的但把算力翻倍和功耗大幅下降放在一起信号就很明确了机器人芯片的内卷已经从单纯的算力军备竞赛转到了能效比和系统简化能力。这篇文章不打算复述官方新闻稿而是想从几个更实际的角度聊聊——78 TOPS到底处于什么水平、这颗芯片解决了机器人开发里的哪些老毛病、国产玩家追赶的进度和差距在哪以及最关键的如果你正在做机器人产品该怎么评估自己到底需要多少算力。1. 一块机器人芯片为什么把翻倍和降40%放在一起说1.1 先看懂TOPS这把尺子78 TOPS在主流芯片里排什么位置TOPS的全称是Tera Operations Per Second每秒万亿次操作。这个单位在AI芯片里几乎成了通用货币但它有一个容易被忽略的前提TOPS数字通常是在INT8整数精度、稠密计算模式下测出来的换成FP16、FP4或者稀疏模式数字会完全不同。英伟达新芯片标出的78 TOPS大概率也是INT8稠密算力这是目前边缘机器人芯片最通用的标称口径。为了看清78 TOPS的定位我把目前市面上常见的几款边缘/机器人AI芯片拉了个表芯片/平台标称算力典型功耗档位应用场景Jetson Orin Nano 上一代40 TOPS7W-15W入门级机器人、小型无人机Jetson Orin Nano Super软件增强67 TOPS7W-25W入门级生成式AI、桌面级机器人开发英伟达新款机器人芯片78 TOPS官方称功耗比上代降40%人形机器人、具身智能端侧平台Jetson Orin NX100 TOPS10W-25W中端移动机器人、机械臂Jetson AGX Orin275 TOPS15W-60W高端自动驾驶研究、复杂视觉SLAM地平线征程6系列高配560 TOPS旗舰十几瓦到几十瓦不等智能驾驶、机器人从这个对比能看出78 TOPS并非顶配但它卡在一个很有意思的档位上比入门级的40 TOPS翻了一倍又比NX的100 TOPS低一些功耗却压到了上代40 TOPS产品的六成左右。换句话说英伟达并没有试图用这颗芯片去替代AGX Orin之类的旗舰而是瞄准了性价比足够高、散热足够友好、能塞进人形机器人躯干或轮式机器人底盘的甜点位。1.2 功耗降40%为什么比算力翻倍更值钱很多非硬件背景的开发者看到算力翻倍会觉得兴奋但做过机器人量产的人会告诉你功耗降40%可能才是更重要的那个数字。原因很简单机器人是移动平台电池容量有限散热条件远比服务器糟糕。以一台20公斤级的轮式配送机器人为例电池可能只有几百瓦时要同时供给电机驱动、传感器、主控和通信模块。如果主板的SoC功耗从15W降到9W看似只省了6W对整机而言却意味着续航时间可能提升15%到20%同时散热片和风扇可以缩小甚至去掉机身可以做更小噪音更低防护等级也更容易做高。我见过不少团队在开发阶段用高功耗的显卡或者开发板跑算法效果很好一到量产阶段就傻眼散热压不住、电池不够用、结构工程师为了塞散热器把外壳改了一遍又一遍。所以英伟达这次把功耗降40%作为一个核心卖点其实是在回应整个机器人行业最痛的量产痛点——不是芯片不够聪明而是芯片太热、太费电装不进真正的产品里。2. 机器人芯片的隐形门槛为什么不能拿显卡或者手机SoC来凑合外行看机器人芯片第一反应往往是为什么不直接用显卡或者手机SoC算力也有几十TOPS价格还便宜用手机芯片不行吗这个问题如果放在三年前还有一定讨论空间但放到现在答案很明确机器人对芯片的要求和显卡、手机SoC完全是两个维度。2.1 实时性与确定性控制回路里没有卡一帧显卡的设计目标是吞吐量是尽量把每一毫秒的计算资源都塞满为此即使单个任务的延迟出现几十毫秒的抖动对游戏渲染来说也无所谓——顶多掉个帧。但机器人完全不同尤其带运动控制的产品控制回路通常跑在100Hz到1000Hz也就是说从传感器数据采集到控制指令输出整个闭环的延迟预算可能只有1到10毫秒。如果主控芯片的GPU任务调度出现一次可预测性很差的排队哪怕只造成5毫秒的抖动电机就可能出现肉眼可见的抖动甚至震荡。专用机器人芯片通常采用CPUGPUNPU的异构架构并且会强调硬实时的任务调度能力。英伟达在这方面的底气在于Jetson平台沉淀多年的驱动和实时补丁能够让GPU和NPU的计算任务通过CUDA流和事件机制与实时内核协同保证关键控制任务的优先级不被AI推理抢占。这一点是普通显卡和手机SoC很难做到的因为它们的设计目标是通用计算或用户交互而不是必须在这个周期内算完的确定性。2.2 内存带宽与异构调度TOPS以外真正的瓶颈只看TOPS来选芯片是很多新手最容易踩的坑。实际上机器人端侧跑AI任务时真正限制性能的往往是内存带宽和异构调度的效率而不是峰值算力。举个例子一个视觉语言模型VLM比如3B参数规模在端侧做一次推理需要把模型权重从DDR读到计算单元。如果是FP16精度3B参数就是6GB权重即使DDR5带宽做到60GB/s光读权重就需要约100毫秒。这个速度别说实时控制连流畅的语音交互都够呛。这也是为什么现在边缘AI芯片纷纷加入INT4/INT4量化支持——权重大小直接砍到四分之一内存带宽压力骤降。异构调度同样关键。机器人通常同时跑多个模型视觉里程计、障碍物检测、语义分割、语音识别、大模型对话……这些任务有的要低延迟有的要高吞吐有的只占用很少资源。芯片是否有成熟的调度框架能不能让这些任务共用GPU/NPU而不互相干扰直接决定最终实际发挥的性能。英伟达这边的答案是CUDA生态和TensorRT的显存池复用机制开发者优化起来相对顺手而其他芯片厂商往往需要开发者自行处理任务调度成本高下立判。2.3 软件栈与开源生态英伟达真正难追的地方如果要给英伟达的机器人芯片找一个最深、最难突破的护城河我会毫不犹豫选软件生态而不是硬件算力。从JetPack SDK到TensorRT从Isaac ROS到Isaac Lab再到最近开源的人形机器人基础模型GR00T N1英伟达几乎把机器人AI开发全链路的关键中间件都摸了一遍而且大部分是开源的官方GitHub上可以直接拿到源码、权重和示例社区里围绕Jetson做的教程、Demo、预训练模型也是所有边缘平台里最丰富的甚至连机器鸭这种用强化学习教鸭子走路的开源趣味项目都能成为开发者练手的入口。这意味着什么意味着一个刚入行的开发者用英伟达平台可能一个周末就能把物体检测、语音对话、导航避障串起来跑通而换到其他平台光是配置环境、适配算子、调通推理引擎可能就要多花两三周。机器人产品迭代速度快开发周期每缩短一点都是巨大的竞争优势。这也是为什么很多创业公司哪怕觉得英伟达芯片贵也咬着牙选它的原因——省下来的开发人力成本远高于芯片本身的价差。3. 算力翻倍又降耗制程、精度和架构的三角账3.1 制程、架构与精度游戏从INT8到FP4按照行业通用规律算力翻倍同时又降功耗背后通常有三板斧更先进的制程、更聪明的架构、以及更激进的精度策略。制程方面从上一代的8nm级别工艺升级到5nm/4nm同功耗下逻辑密度和能效比都会有明显提升这是物理层面的红利。架构方面英伟达一直在把数据中心GPU上验证过的Transformer加速能力下放到边缘端具体到这颗机器人芯片上很可能集成了专门的Transformer推理加速模块让大模型相关的矩阵计算走专用路径避免占用通用GPU核心。精度策略更值得留意。过去边缘芯片标TOPS普遍以INT8为准但现在越来越多芯片把FP4甚至更低精度纳入标称范围因为FP4的一个乘法运算要比INT8节省约一半的能耗算力数字却可以翻倍。英伟达在数据中心已经大量支持FP4如果这颗机器人芯片同样支持FP4那么78 TOPS可能还只是INT8口径实际在FP4下能跑到更高的数字——但机器人场景对精度敏感FP4未必适合所有任务所以这个数字看看就好真正选型时还是要以INT8或者FP16的实际性能为准。3.2 专用加速模块Transformer引擎下放到边缘机器人端侧正在经历一个明显的变化从跑CNN模型转向跑Transformer模型。不管是视觉任务里的ViT还是多模态大模型里的注意力机制Transformer架构都和传统CNN的计算特征不同——它对显存带宽的需求更猛对稀疏结构的容忍度更高也更适合用张量核心做矩阵分块计算。英伟达这次把Transformer引擎下放到机器人芯片底层逻辑是未来机器人端的AI主力一定不只是YOLO这类轻量检测模型而是能够理解环境、理解指令的视觉语言大模型。如果芯片架构还停留在几年前的CNN优化逻辑跑起来会非常吃力。通过加入针对注意力机制的加速单元并在驱动层和TensorRT里做算子级优化这颗芯片才能在算力并不夸张的前提下把大模型推理的实时性做到可接受。这也是为什么很多人说78 TOPS的数字不是重点重点在架构完成了针对具身智能与端侧大模型的新一轮适配。3.3 警惕数字翻倍的陷阱读TOPS时必问的三个问题前面提到精度策略这里想展开多说一句任何厂商发布芯片时给你看的TOPS都要先问三个问题再下结论。第一个问题什么精度下的TOPSINT8、FP16、FP4数字完全不同不能横向比。第二个问题稠密还是稀疏稀疏算力可以比稠密高接近一倍但实际模型如果稀疏度不够这数字兑现不了。第三个问题算出来的操作是什么口径有的芯片标的是MACs有的标的是FLOPs一个MAC等于两次操作直接比数字会吃大亏。我在实际项目里就踩过这个坑。曾经有个供应商强调自家芯片有几百TOPS明显比英伟达同级产品高结果拿回来一测那个数字是FP4稀疏算力实际跑INT8稠密模型性能连英伟达的一半都不到。所以看任何芯片的性能参数先别急着兴奋问清楚口径再拿真实模型去跑基准测试这才是靠谱的做法。4. 国产追赶者卡在TOPS之外的三件套上标题里提到国内玩家也在加速追赶这个话题在行业里确实天天有人聊。聊到国产替代很多人第一反应是算力赶上了没有但实际深入了解会发现算力早就不是最核心的差距了更关键的短板在别的地方。4.1 国产机器人芯片的主要玩家和产品进度国内做边缘AI芯片的厂商这几年在机器人赛道的存在感明显增强。地平线的征程系列一直是智能驾驶领域的重要玩家而且明确推出了面向机器人的征程6系列覆盖从轻量级到高算力多个档位最低十几TOPS旗舰能做到几百TOPS从产品的性价比和软件工具链来看在国产阵营里属于第一梯队。另一个值得关注的是地瓜机器人脱胎于地平线的机器人业务产品围绕旭日系列展开重点在开发套件的易用性上做文章瞄准的是中小开发者群体。算能、黑芝麻智能等公司也在边缘芯片上持续发力有的主攻视觉AI有的盯上行泊车/机器人底盘产品规格各有侧重。至于寒武纪这类背景的AI芯片公司目前主要面向云侧和大型训练任务端侧机器人产品不算主力方向但也在布局。单看TOPS国产芯片和英伟达的差距其实已经不是天壤之别。征程6的高配在算力数字上甚至超过英伟达的旗舰部分国产芯片在能效比上的表现也可圈可点。但落到实际产品选型时好多机器人公司还是优先看英伟达这就是生态的力量。4.2 TOPS已经不是最大差距三件套才是如果把一款机器人芯片能否落地比作一个产品那么决定成败的绝不只是裸芯片本身而是工具链、算子库、开发者社区这三大件。工具链的意义在于能不能把模型计算图和算子跑得高效。英伟达的TensorRT经过多年迭代支持几乎所有主流模型的算子融合、量化、动态维度开发者只需要做少量配置就能获得不错的加速比。而国产芯片的工具链哪怕在拼命追赶很多模型的适配仍然需要手工改算子、补优化部分小众模型甚至直接不支持。算子库是容易被低估的一环。Transformer、传统CV、语音识别、点云处理不同模型依赖的算子差异很大芯片厂商需要针对每个算子做深度优化才能发挥硬件性能。这块拼的是时间和人力短期很难弯道超车。开发者社区更是慢变量。英伟达Jetson在全球拥有海量开发者提问能找到答案踩坑能找到案例开源项目几乎全网都是。国产芯片厂商的社区虽然也在快速建设但数量和深度差距明显。对于技术团队来说搜不到答案本身就是一种隐形成本很多时候足以让选型的天平倾斜。4.3 大模型带来的国产追赶窗口期话说回来国产玩家也没有坐以待毙且这一轮大模型浪潮确实带来了难得的窗口期。一是端侧大模型部署的需求刚刚爆发大家都在摸索还没形成绝对的规范和惯例二是国产芯片在中文语音、中文大模型的适配上有天然优势如果能把开源的Qwen、DeepSeek之类的中文模型在自家芯片上优化到好用程度本地化服务反而是英伟达不一定能顾得上的市场。另外国产芯片在成本、供货稳定性以及定制化服务方面的灵活性都是英伟达在全球化架构下难以匹敌的。很多国内机器人公司开始走双轨方案——研发阶段用英伟达量产阶段评估国产。随着国产工具链逐步补齐这种切换会越来越顺畅。但说实话到底什么时候能真正形成生态级竞争力我不觉得是三五年内能见分晓的事更可能是长期拉锯战。5. 78 TOPS够不够用从任务倒推算力的粗估方法最后回到每个机器人开发者最关心的问题78 TOPS对我到底够不够用这个问题没有标准答案因为它取决于你的任务类型、模型大小、帧率要求和功耗预算。但我们可以掌握一套粗估方法很快算出需求。5.1 用一个YOLOv8例子算清楚TOPS需求以最常见的物体检测任务为例YOLOv8s在640x640输入分辨率下的计算量大约是28.6 GFLOPs。假设我们需要实时处理30FPS的视频流每秒需要的算力就是28.6乘以30约858 GFLOPs也就是0.858 TOPS。但注意这只是理论计算量。实际的芯片利用率不可能达到100%考虑到内存带宽、调度开销、量化损失等因素一个模型的实际算力利用率通常在20%到40%之间。所以保守起见按30%利用率估算跑一个YOLOv8s需要大约3 TOPS的有效算力。如果机器人同时跑YOLOv8s检测、语义分割、行人追踪、视觉里程计这四类任务总需求大约在10到15 TOPS之间。从这个角度看78 TOPS对大多数传统机器人视觉任务来说可以说非常充裕甚至有些浪费。真正需要大算力的场景是端侧大模型任务。比如跑一个7B参数的视觉语言模型每个token需要大约14 GFLOPs如果要求生成速度达到20 token/s需要约0.28 TOPS。单纯看算力需求并不高问题在于内存带宽7B参数FP16权重就是14GB即使DDR5跑到80GB/s读一遍权重也需要约175毫秒生成速度只能维持个位数到十几token/s。所以想流畅跑大模型瓶颈更多在内存容量和带宽而不是TOPS。5.2 跑大模型机器人算力是伪需求带宽才是真瓶颈这个判断可以再展开一点。端侧大模型推理通常分为预填充处理输入和解码逐个输出token两个阶段。预填充阶段是计算密集解码阶段则是访存密集特别是在批量大小为1的对话场景计算量很低基本被内存带宽卡死。所以当你决定要在机器人上跑一个端侧大模型时先别只看芯片标了多少TOPS更应该关注内存带宽、内存容量以及芯片是否支持低比特量化。以78 TOPS这颗芯片所在的新一代平台为例如果官方宣传支持更低的INT4量化同时内存带宽相比上代有明显提升那它跑大模型的实用体验会比同样TOPS但带宽低的芯片好得多。这也是为什么GPU的显存带宽那么重要——在端侧也同理。5.3 选型经验开发板、量产芯片和30%裕量原则基于我过去帮几个团队做芯片选型的经验有几点可以分享。首先是开发阶段选型。如果预算允许尽量选算力比需求高一倍的开发板。原因很简单开发阶段要跑很多中间模型要做可视化和调试还要给后续算法迭代留余量算力太紧会严重影响开发效率。英伟达Jetson生态的好处就在于此同一套CUDA代码可以从低配板卡平滑迁移到高配板卡开发到量产的无缝性很关键。其次是量产芯片的裕量原则。当你的算法已经在开发板上跑通并且测出了实际峰值占用率量产芯片的算力需求大约按峰值占用率再乘1.3来选同时要叠加功耗裕量。比如开发板在满负载时功耗18W量产时不能选一个极限功耗18W的芯片至少留20%到30%的功率余量否则部件老化和高温环境影响会很明显故障率会显著上升。最后是价格之外的隐性成本。很多团队只盯着芯片单价忽略了软件适配、工具链学习和维护的人力成本。如果芯片单价便宜但每个算子都要自己调那整体成本反而更高。我在项目里通常会给客户这样一个建议如果团队规模小、研发周期紧优先选生态成熟的芯片如果团队工程能力强、有充裕的软件优化能力再考虑更具性价比的国产方案并行验证。关于这颗78 TOPS芯片我个人的看法是它更像是英伟达在具身智能浪潮下面向端侧大模型实时控制这一新需求给出的标准答案。算力数字并不是最惊艳的真正值得关注的是它把功耗压下来之后让更多机器人形态能够把大模型装进机身里。如果你正在做下一代机器人产品不妨认真看看这颗芯片的实际部署效果同时留意国产团队在工具链和生态上的最新进展。无论如何机器人芯片这一局好戏才刚刚开始。