乐竞体育(中国)官方网站-LEJING SPORTS

NEWS CENTER
THE LATEST ADVICE ON THE INDUSTRIAL DESIGN INDUSTRY
从站稳再伸手到全身协同,机器人形态设计正在重写规则
阅读:7   更新时间:2026-08-02 18:15:00

WAIC 2026的现场,超过两百家机器人企业和三百多台真机挤满了展馆。宇树的三米载人变形机甲在人群上方切换形态,智元的机器人用镊子夹起两毫米电阻焊到电路板上,后空翻和机械舞依然能围拢观众,可厂商们想证明的事情已经变了。机器人能做的动作越来越多,大家关心的焦点却从"身体"移到了"大脑"。怎么让机器人看懂混乱的环境,决定下一步做什么,再把决定稳定地送到几十个关节,这才是眼下最紧的瓶颈。

展会结束一周多,Google DeepMind端出了Gemini Robotics 2,一个主打全身智能的机器人通用模型。对做工业设计的人来说,这个发布的分量不止于算法层面的迭代,它直接动到了机器人形态设计的底层逻辑。过去画一台机器人,腿是腿,手是手,躯干是躯干,每个部位的功能边界清晰,外观上也能顺着这个边界切分。全身智能一旦落地,这些边界就开始模糊了。

所谓全身智能,拿人类的动作做参照最直观。弯腰捡地上的水壶,人会自然前倾、屈膝、伸手,同时调整重心。封一只自封袋,手指会从一端捏到另一端,根据塑料形变随时调整力度。这些动作在人身上浑然一体,放到机器人身上却要连续算对一串彼此牵制的动作。身体零件越齐全,控制难度越像滚雪球。胳膊伸得远,身体就得前倾;身体前倾,双腿必须及时补偿。任何一个环节算慢了或算错了,整台机器就可能晃一下甚至摔倒。

谷歌这次的发布包含三个模型。Gemini Robotics ER 2负责理解环境、规划长任务和与人沟通,Gemini Robotics 2这个VLA模型把视觉与语言直接转成动作,On-Device 2则把动作模型压到本地,能用少于两百个样例、几小时数据适配新的机器人本体。三件套各有分工,核心在于谷歌开始用一组模型协调一台人形机器人的双腿、躯干、双臂和手指,让它一边思考推理,一边移动操作。

过去不少机器人演示,都有一种很强的回合制游戏感。机器人先走到桌边、停下、站稳,然后调用机械臂抓取物体;抓完以后再切换到行走控制器,去往下一个位置。每一段动作单独看都做得挺好看,可桌子偏了一点、物体滑了一下,或者它必须边走边维持抓握,几个独立模块的接缝就露出来了。这种割裂感对工业设计的影响很直接。设计师在构思机器人整体造型时,往往会按照"行走模块""操作模块""感知模块"来划分体块和曲面,让外观反映内部功能分区。模块之间需要停顿和切换,外壳上自然就多出接缝、转轴护罩和各种功能分区线。

上一代Gemini Robotics主要控制机器人的上半身,处理桌面任务。到了Gemini Robotics 2,官方视频里的Apptronik Apollo 2会走向放在地上的绿色水壶,弯腰把它提起来。另一段画面中,Apollo 2走到货架前取出一只棒球手套,随后转身离开。这些动作看起来平平无奇,背后同时依赖视野、可达范围、步态和重心。视频特别标注,画面中的机器人均为自主运行,动作按真实速度播放。这就是全身的实际含义。模型不再把腿当运输工具、把手当作业工具,而是把整副身体视为一个相互耦合的动作空间。同一个模型已经用于搭载不同灵巧手的Apollo 2,以及使用两指夹爪的Franka Duo。在技术方向上,它想做的不只是一颗适配某款人形机器人的专用大脑。

从设计角度看,全身协同对结构布局提出了新的要求。当腿部不再只是一个独立的底盘,手臂也不再是上半身的独立终端,整台机器人的配重、关节排布、线缆走向和外壳分模线都要重新考虑。髋关节和腰关节的活动范围需要配合手臂前伸时的重心补偿,胸腹部的外壳曲面要为大角度前倾留出余量,膝关节附近的壳体不能在深蹲时与小腿干涉。这些约束在"先站好再伸手"的时代可以分段处理,如今必须放在同一个动作空间里统一校验。创品在服务高端装备和机器人客户时,对这类跨模块协同有切身体会。创新力体现在能不能率先看到形态和结构的耦合机会,专业力体现在能不能把关节运动包络、线缆寿命和装配顺序一次算清楚,控制力体现在能不能在结构复杂度上升的同时把BOM成本和模具费用稳在可接受区间,保障力体现在从手板到量产的每一轮评审都有明确的风险兜底。四力五维不是贴在墙上的口号,是每一次分模线调整和每一次壁厚优化背后实实在在的判断标准。

演示也没有快到让人产生错觉。Apollo走路、下蹲和摆放物体的速度都很慢,谷歌自己也承认移动速度仍需提高。官方测试中,Apollo从桌面、地面和货架取物的平均成功率分别为68.4%、45.7%和76.3%。最能体现全身控制的地面取物,恰好也是成功率最低的一项。方向对了,动作还不够利索。对设计师而言,这组数字传递了一个务实的信号:近期落地的人形机器人在外观上不需要过度追求运动感和速度感,稳重、可靠、便于维护的形态语言更符合当前的能力边界。壳体上的散热开口、检修盖板和快拆结构,在量产维上的权重甚至比曲面的雕塑感更高。

全身控制解决的是机器人怎么抵达、怎么站稳。真正决定它能不能进入家庭和工厂的,往往是最后几厘米。官方视频里,Apollo 2使用一只拥有二十二个自由度的五指SharpaWave灵巧手,尝试拧灯泡、封自封袋、给垃圾袋打结。Franka Duo的两只夹爪负责把形状各异的工具紧密装进工具箱。过去机器人最常见的抓取演示,往往只是把一个硬物从A点搬到B点。这些任务涉及连续接触、双手配合和形变,塑料袋会塌,绳结会滑,灯泡既要对准螺纹又不能捏得太用力。

人类做这些事时不会先想好二十二个关节各自旋转多少度。Gemini Robotics 2要做的,正是从视觉和指令直接生成这些高频、连续的动作。可谷歌公布的成绩很实诚。两指夹爪在通用抓放、工具配套和精密插入上的平均成功率达到74.2%、78.9%和89.6%。到了多指灵巧手,差距迅速拉开:拧下灯泡92%,拧上灯泡只有36%,扎垃圾袋44%,使用簸箕和封自封袋分别只有32%和40%。这组数字说明大模型已经能接管相当复杂的手部动作,多指灵巧操作远没有达到官方模型页面所说的人类级。机器人拧灯泡仍然可能十次失败六次。

最后几厘米的困境,对手部设计和整机CMF策略影响深远。灵巧手的指节形态、指腹材质、掌心曲面,直接关系到接触摩擦力和形变适应性。灯泡螺纹需要的精准旋转、塑料袋需要的轻柔捏合、垃圾袋打结需要的拉力控制,对指尖传感器和柔性表皮的要求各不相同。好看维在这里不能单靠曲面和配色解决,材料的触感、弹性和耐脏性同样是视觉体验的一部分。专利维则体现在指腹纹理、快换指尖和模块化手掌结构的知识产权布局上。换一副指尖就能适配不同场景,这种模块化思路既降低了单台机器人的硬件成本,也为后续的配件生态留出了空间。成本维上,二十二自由度灵巧手的减速器、电机和传感器目前价格不菲,怎么在保证性能的前提下做减法,是工业设计团队和硬件工程团队必须共同面对的课题。

第三个变化是协作。视频中Apollo与Franka Duo共同整理工具箱。Apollo发出任务,Duo把工具装入盒内,两台机器人各自运行一套模型,通过高层推理分配和衔接工作,而不是由一个中央神经网络同时操纵两副身体。ER 2还会持续查看视频,判断任务进度、发现失败并决定是否重试。这和两台机器人机械地执行预设工序不太一样。谷歌想让不同形态的机器人先理解彼此擅长什么,再像团队一样交接任务。只是官方视频展示的是一个经过设计、总长几分钟的工具收纳场景,离多台机器人在真实工厂里连续协作几个月,还隔着很长的稳定性验证。

多机协作对外观设计也有微妙影响。同一工位上如果出现两种以上形态的机器人,它们的视觉语言需要有一定的家族感,操作人员才能快速辨认各自的角色和状态。灯光提示、色彩编码和表面纹理在这种场景下承担了信息交互的功能。合规维的要求也随之升级,多台机器人共享工作空间时,安全防护范围、急停逻辑和人机协作距离都需要在设计阶段提前纳入评估。创品在做装备类项目时,通常会把CE认证和功能安全要求嵌进草图阶段,而不是等样机出来再补。好看与合规可以并行,前提是设计师对法规框架有足够深的理解。

具身智能行业目前普遍将机器人架构概括成大脑和小脑。大模型负责看懂指令、拆解任务,小模型和传统控制器负责导航、平衡、抓取。这样做很务实,高层推理不需要每秒运行数百次,底层控制也不能等一个大模型慢慢思考。模块分开,部署、调试和安全兜底都更容易。问题在于物理世界并不喜欢整齐的模块边界。抬起一个重物会改变平衡,向前迈步会改变手臂的可达范围,手里的杯子一滑,原来的路径规划马上作废。高层计划与底层动作只要理解不一致,错误就会在长任务中累积。每次从行走切换到抓取、从抓取切回导航,也可能带来停顿。机器人明明计划对了,身体却没有照做。

严格来说,谷歌没有放弃大小脑。ER 2依然是高层大脑,负责看、想、规划和调用工具,再把动作执行交给VLA。它甚至可以把导航API、机械臂接口和其他厂商的VLA当成工具。谷歌解决的是在动作层继续把走路、平衡、躯干和手臂切成一堆互不相干的小脑。Gemini Robotics 2用一个VLA统一全身动作,ER 2则可以一边观察执行一边思考后续步骤,减少机器人每做一步都要停下来想想的割裂感。这是一条更准确的分界线:高层仍然分层,身体开始端到端。

这也解释了谷歌为什么没有把所有环节都塞进一个巨型网络。机器人底层控制追求毫秒级响应,高层推理却可能要检索资料、理解人类含糊的要求。两者需要的算力、数据和运行频率都不同。全部揉在一起,训练成本会迅速上升,出了问题也很难判断究竟是计划错了还是关节没有执行到位。更现实的是安全。模型可以决定把水壶放到货架,急停、限速和人与机器人的安全距离却不能只靠概率保证。ER 2引入安全约束、可行性判断和请求人类介入,底层仍保留传统物理安全机制,说明谷歌也没有打算让端到端学习包办一切。

架构层面的取舍对工业设计有直接映射。分层架构意味着机身上需要容纳不同算力等级的计算单元,高功耗的推理芯片需要主动散热,底层控制器则讲究实时性和抗干扰。散热风道的形态、检修门的位置、主控仓的密封等级,都要在外观曲面上找到合理的出口。全身端到端控制对关节内部的总线带宽和传感器密度提出了更高要求,线束直径和接头数量增加,留给外壳的内部空间反而被压缩了。量产维上,怎么在狭小的腔体里完成布线、打胶和固定,直接影响装配工时和售后维护效率。控制力就是在这些缝隙里体现出来的。

这条路线也不是谷歌独有。Figure在今年初发布的Helix 02,同样把所有传感器接入一个全身视觉运动策略,让System 1以200Hz输出全身关节目标,再由System 0以1kHz处理平衡和接触,最上层的System 2继续负责语义推理。看起来像一个模型,内部仍是按不同时间尺度紧密咬合的三层系统。智元最新的GO-2也直接把问题称为语义到执行的鸿沟,用动作思维链与异步双系统连接低频规划和高频执行。大家没有简单地在一个模型和大小脑之间二选一,而是在缩短模块之间传话的距离。

系统思维告诉我们,一个系统的整体表现取决于各部分之间的连接方式,而不是单个部件的性能上限。机器人行业正在经历的这种架构调整,本质上就是重新设计连接方式。当模块之间的传话距离缩短,关节响应和高层意图之间的时滞减小,机器人的动作才会真正流起来。对工业设计而言,这种系统层面的变化会渗透到产品的每一条曲面和每一个结构件上。设计师需要理解控制架构,才能预判未来三年内机器人的形态会往哪个方向收敛。创品在做产品规划时,习惯把技术路线图和造型语言路线图叠加在一起看,专利布局也提前两到三年介入,避免等产品火了才发现核心结构已经被别人注册。

目前具身智能模型的前沿探索,大致都在追三件事:更多本体、更长任务和更少的专用数据。英伟达开源的GR00T N1.6吃进了数千小时遥操作数据,已经在智元Genie-1、宇树G1和不同双臂平台上进行后训练,并把全身移动操作纳入数据集。Physical Intelligence的π0.5混合不同机器人、网页知识和高层子任务数据,让轮式双臂机器人在陌生住宅里连续清理厨房和卧室,任务时长达到十到十五分钟。蚂蚁灵波开源的LingBot-VLA 2.0用六万小时数据覆盖二十种机器人构型,还把手臂、灵巧手、腰、头和移动底盘映射进统一动作空间。

这些都越来越像大语言模型早期的竞争:先用多任务、多本体数据训练一套基础能力,再花少量数据适配具体硬件和场景。Gemini Robotics On-Device 2用不到两百个样例适配新本体,最值得关注的也在这里。假如换一副机械臂、换一套传感器都要重新采集海量数据,所谓通用模型就很难形成规模效应。对工业设计公司来说,适配成本下降意味着硬件迭代速度会加快。同一个大脑装进不同身体,外壳和结构件的开发周期必须跟上模型更新的节奏。模块化平台设计、通用安装接口和可复用的内部支架,会成为机器人产品开发的标准配置。创品在多个装备项目中积累的DFM经验,在这个节点上正好能帮客户把研发投入转化为可量产的产品。好看维和量产维之间的平衡,需要专业力来做支点。

但机器人比聊天模型更难糊弄。英伟达在GR00T N1.6的说明中仍承认,多任务语言跟随和分布外泛化是持续挑战。谷歌的五指任务成功率也清楚表明,同一个模型能控制不同身体,不等于它已经稳定掌握所有身体。真实部署还要面对磨损、电量、碰撞、人类突然闯入和网络中断。这些变量对工业设计的可靠性设计提出了很高要求。外壳材料的抗冲击性、表面处理的耐磨性、关节处的密封防护、电池仓的快拆结构,每一项都要在实验室和产线上反复验证。保障力落实在流程上,是三审制和风险清单,落实在产品上,是用户拿到手以后不会因为一次磕碰就停机。

维克多·帕帕奈克在《为真实世界设计》中说过,设计要解决的是多数人的真实需求,而不是制造昙花一现的视觉刺激。机器人行业当下正处在一个容易被演示效果带节奏的阶段,后空翻、机械舞和各种炫技动作确实抓人眼球,可真正能改善生活的场景,是机器人弯腰捡起掉在地上的杯子,顺手擦干洒出的水,再在我们回家前把房间收拾好。这些场景需要全身智能,需要灵巧操作,需要长任务规划,也需要工业设计师把每一个交互细节、每一处表面材质、每一次维护体验都想透。设计的价值在这个阶段格外清晰:算法决定机器人能做什么,设计决定人愿不愿意让它走进自己的生活。

Gemini Robotics 2最重要的地方,不是给机器人装上了一颗突然开窍的大脑,是在于让具身智能模型开始越过桌面和上半身,把走路、平衡、精细操作、长任务与多机协作放进同一张考卷。相较之下,之前一种任务对应一组算法的做法,更接近前大模型时代的AI。WAIC上那些越来越成熟的芯片、关节和整机,已经为AI准备了很多副身体,谷歌这次试图证明模型也开始学会把身体当作一个整体来使用。

对工业设计行业来说,这意味着一轮新的范式转移。过去设计机器人,先确定形态类别,再分配功能模块,然后在模块边界上画曲面。全身智能时代的设计起点变了,要从动作本身出发,先理解身体各部位在连续任务中的耦合关系,再决定壳体怎么包裹、关节怎么外露、传感器怎么隐藏、灯带怎么呼吸。形态不再是内部模块的外包装,而是全身动作流在物理世界的视觉凝固。这个转变需要设计师同时懂控制逻辑、人机工程、材料工艺和品牌语言,门槛比以往任何时候都高。

江苏创品工业设计在高端装备、医疗设备和家电板块沉淀多年,凭四力做五维的方法论恰好能在这波浪潮里帮客户把复杂问题拆清楚。创新力盯着全球技术趋势和造型方向,专业力扎进行业语汇和认证要求,控制力守住BOM成本和工艺可行性,保障力托住从原型到量产的交付全流程。好看维、专利维、合规维、成本维、量产维,每一个维度都对应着机器人落地过程中的真实关卡。四力五维,创品有道,这句口号背后是一个一个项目磨出来的判断力。

至于机器人什么时候能真正走进厨房,弯腰捡起掉在地上的杯子,擦干洒出的水,再在我们回家前把房间收拾好,那需要的不只是全身智能。它需要更灵巧的手、更耐久的关节、更安全的交互、更亲民的成本,以及一整套让人信任的外观和体验。工业设计在这条链路上从来不是配角,它是把技术能力翻译成用户可感知产品的最后一道工序。模型学会了使用身体,设计师要学会的,是帮这副身体找到它在人类生活中的位置。
已累计预约 5360
  • 手机号 预约成功
  • 手机号 预约成功
  • 手机号 预约成功
  • 手机号 预约成功
  • 手机号 预约成功
  • 手机号 预约成功
  • 手机号 预约成功
  • 手机号 预约成功
  • 手机号 预约成功