人形机器人能跑会跳,为啥一进家门就露怯?

频道:行业资讯 日期: 浏览:32

从春晚的舞台之上, 到马拉松的赛场之中, 人形的机器人频繁地出现于大众视野, 具有身体可行动能力的智能技术迎来了快速进行迭代更新的风口。

工业和信息化部与国务院国资委联合印发通知了, 通知是关于联合开展专项行动的一项通知, 专项行动是2026年度人形机器人与具身智能实景实训专项行动, 该通知明确了目标, 目标是2026年底实现重点产品可以常态部署, 并且能达到万台级规模落地, 政策利好在持续释放。

走势不断攀升的是市场预期, 行业报告作出预判, 2026年的时候, 人形机器人“量产元年”有望降临, 中国具身智能机器人市场规模将会突破110亿美元, 在全球占比超过三分之一的市场份额, 多重红利进行加持的情况下, 具身智能产业步入到发展黄金期。

然而, 在那聚光灯之下, 暗藏着尴尬的状况, 就是很多人形机器人能够顺畅地完成诸如跑跳、舞蹈、特技等具有高难度的动作, 可是, 一旦进入到真实的家庭场景之中, 难免就会屡屡显露出怯懦的样子。

历经“明星样机”阶段进入“量产落地”进程, 具身智能机器人想要进入家庭, 到底还得突破几道阻碍呢。

听懂与做到之间,“理解”很难

有着水杯的桌子, 明天会变成因水果、玩具和药品而变化物理状态的存在, 且开放且不断变化的家庭环境, 会因老人、小孩、宠物的活动持续改变状态。

典型的非结构化环境是家庭, 不固定的环境, 不固定的任务, 不固定的家庭成员习惯, 这正是它同标准化工业场景相区别的本质, 极佳视界合伙人、研发副总裁叶云向记者如此解释。

这意味着机器人在家庭中,面对的是一个时时变化的开放世界。

, 中国科学院自动化研究所的研究员陈盈盈表明, 具身智能机器人于“非结构化开放世界”里的泛化能力欠缺, 这是它步入家庭场景时最为重大的技术阻碍。

她列举出了一个示例, 这个示例是较为简单的, 其内容为: “在桌子的边缘之处放置着一个处于半满状态的玻璃杯, 对于这个杯子, 机器人不但需要识别出其‘是杯子’这一属性, 而且还应当凭借相关信息推断得出它是具备易碎特性的, 它里面是存有液体的, 并且只要受到轻微碰撞就存在可能掉落的情况。”。

叶云还用“那杯水”作出阐释, 对着机器人讲“把桌上那杯水递给我”, 在语言方面它完全能够领会。然而要实际行动, 它必须清楚何为桌子与杯子, 还有杯子于三维空间里准确的所在位置, 该运用多大的力量去握住杯子, 水满的时候移动应当保持平稳, 递至人手中时要等到对方握住才可松开手。

但这些并非是被写于指令之中, 而是被镌刻在物理世界的规律里面。机器人具备能够“听懂”指令的能力, 然而截至距离“做到”的程度, 还需要它针对三维空间、物理因果以及动力学规律拥有深刻的“理解”才行。

现阶段, 诸多机器人因经过训练得以识别出一个杯子, 然而, 识别出杯子与“领会杯子究竟是什么、像人那般去识别杯子”全然是两码事儿。仝人智能科技(西安)有限公司的创始人兼总经理吴易明表示, “理解”乃是最为关键的核心词汇。

当下行业里讨论最为频繁的是模型、算法以及参数规模, 然而机器人若要进入家庭, 其真正所需突破的, 乃是如同人那般理解物理世界、理解空间关系、理解事物共性的能力, 而这需要智能科学底层理论的突破。吴易明觉得, 只有切实具备了“理解能力”, 像人类一样理解自身与整个物理世界之间的关系, 机器人方可服务家庭真实需求, 在复杂多变的环境中应对各种各样的挑战, 甚至像人类一样运用传统工具来服务人类。

进而, 人类究竟是以怎样的方式去理解实际存在的世界的呢? 针对于记者的进一步追问, 吴易明谈及了图式理论(也就是Schema Theory)里“理解”所具备的定义, 此定义指的便是运用头脑之中预先存在的图式(具体涵盖结构、框架以及认知程序等方面)去诠释一个事物。

我们所期望的是, 机器人可以直接懂得真实世界, 这首要源自于它对传感方面信息的获取, 其与参照人类认知历程, 所构建的和其外部世界的映射关系。其中呀, 理解的关键核心是‘识别’, 正是这种能力, 使得机器人能够做到举一反三, 并且区分出更为具体的差异。

仍拿“那杯水”当作例子。吴易明期望, 具备“理解”本事的具身智能, 并非要经由认识一万个杯子, 仅仅是瞧见一个全新杯子, 便能够晓得它是杯子;处于弄明白它们全都是杯子这样的基础之上, 还能够区分出哪一个是你的杯子, 哪一个是我的杯子。

拥有了像人类一样理解能力的机器人, 便能理解空间关系, 能理解远近关系, 还能理解一些最基本的物理常识, 比如物体为何会掉落, 物体为何会反弹等等。这些都是人类成长过程中天然就具备的能力, 同时也是机器人真正具备智能的重要基础, 吴易明进一步解释。

到目前为止, 令人遗憾的是, 我们欠缺一个针对真实世界的动作模型, 还缺少一个能够对时间、空间、物理规律以及多模态、全模态予以理解、推理、规划、决策的模型。智源研究院院长王仲远直言, 以语言作为主导的基础模型, 并非是高效编码三维空间、物理因果与动作信息的架构。

数据与算法之间,“融通”很难

5月31日起, 由极佳视界研发的第一代家庭通用人形机器人“拾光S1”, 正式进入武汉光谷之寓社区, 开启真实家庭场景测试。它已然能够在真实家庭当中, 分拣并叠放衣物, 取出以及放置餐具, 整理厨房, 让桌面回归原位, 跨越房间去取送物品, 并且还能够执行一些陪伴交互的长程任务。

在一个社区里, 从成功完成几项任务的这种情形, 进展到适合千家万户的状况, 当中距离遥远, 路途漫长。这便表明, 当具身智能机器人进入家庭, 面对各种各样变化多端的场景时, 它能够切实真的实现完成精细入微的任务吗?

叶云觉得, 基础瓶颈存在两个方面, 其一, 是欠缺规模化状态下的, 可以用来描绘物理规律的数据体系, 其二, 是缺少能够以高效方式学习物理规律的算法架构。

来讲讲数据, 成本一直偏高这件事不能不管。大语言模型有海量的互联网文本在给它提供数据支持, 然而具身智能所需的真实家庭数据却是“极为稀少难得, 收集起来成本又超高”。

人形机器人具身智能政策利好 2026年量产元年 中国具身智能机器人市场规模 _ 人形机器人具身智能家庭场景技术障碍 非结构化开放世界 泛化能力不足 _智能机器人行业

作为清华大学副研究员, 同时身为浙江清华柔性电子技术研究院工业具身智能实训中心主任的陈毅豪, 给记者计算成本的时候说道, 真实家务场景里的触觉数据稀缺, 力控数据稀缺, 交互数据同样稀缺, 要是让真机逐个场景去采集数据, 所耗费的成本高到超乎想象, 他还提到, 按照传统采集速度, 积攒满足够训练通用家庭机器人的数据量, 或许要耗费上百年的时间。

在安徽科大硅谷片区, 有一家名为如动科技的企业, 它的创始人兼总经理是朱宝, 朱宝觉得, 物理世界之中, 存有机械臂阻力、光照变化以及地面扰动等这类固有随机变量, 而预训练数据集没办法将全部真实工况都涵盖住, 这就致使具身智能机器人在家庭、户外等开放环境里, 很容易出现行动失灵的状况。

陈毅豪所在团队换了条路径, 推出“无本体数据采集”模式, 此模式下无需机器人到达现场, 而是由人员穿戴轻量化柔性传感设备去完成家务, 在做家务过程中同步记录动作以及触觉数据, 之后经过算法映射成为机器人能够学习的样本。他所在的中心打算以有偿形式面向社会开放采集工作, 预计在今年完成60万小时的采集量, 到2027年要冲刺达到150万小时, 直至2028年建成国家级高质量数据集。

仅仅是“燃料”问题, 那能为数据采集所解决, 然而, 具身智能机器人要靠什么“发动机”去驱动呢? 这关联着算法架构以及技术路线的选取。

在当下的业界范围之内, 对于具身智能所展开的探索活动, 主要存在着三条技术路径, 分别是数据驱动、端到端以及认知驱动。吴易明持有这样的观点, “前面提及的两种路径, 都对规模定律予以了推崇, 秉持大力能够创造奇迹的信念, 并且它们都具备通俗易懂的特点, 很容易在大众范围内受到关注, 进而吸引了大量的资源为其提供加持。然而一直到当前这个时间节点为止, 并没有出现显示度相对较高的具有代表性的突破成果以及能够实现实际应用落地的情况。”。

叶云所认为的技术路线的三层架构是, 基于大规模数据预训练去实现世界模拟, 基于真机数据且真人数据以及仿真合成数据来实现动作对齐, 基于真机数据和仿真合成数据进行持续强化。他还表示, 这几条路径并非是那种非此即彼的单选题, 而这恰恰就是我们提出“双金字塔”体系的出发点, 要借着世界模型把互联网视频、真人数据、仿真合成数据以及真机数据全部打通利用起来, 从而理解基础的物理规律, 进而获得动作生成的能力。用在线强化学习,让机器人在真实环境中实现持续的自我进化。”

含互联网视频数据、真人数据、世界模型模拟器、仿真合成数据、真机数据的五层构成了“数据金字塔”;由世界模拟、动作对齐、经验强化的三层构成了“算法金字塔”。两座“金字塔”彼此相互咬合, 致使机器人起先于海量数据里学会“世界是怎样运转的”, 后续学会“怎样把事做对”, 最终于真实使用期间实现持续强化、越用越聪明。

回归到家庭场景里极具挑战性的“三个不固定”难题, 叶云所采取的解决办法是, “并非依靠针对每个家庭场景去单独进行编程, 而是要凭借基础模型所拥有的通用适应能力”。他身处的极佳视界公司, 已经针对世界模型开展了多次迭代。仅仅是在动作对齐这个层面, 其世界动作模型(World Action Model, 简称为WAM)便能够凭借大约十分之一的实验数据量, 达成全量数据训练的能力水准。

吴易明再三强调, “智能的实质并非记忆世界,而是理解世界。仅仅依靠数据训练无法达成真正的智能。世界并非随机样本的集合, 而是能够被理解的关联结构。”。

仝人智能科技(西安)有限公司的解决办法是, 采用统一数学办法来表现空间结构, 并借此表现物理世界规律, 依靠自主研发的具身智能操作系统, 建立起能直接和真实世界自主交互以及执行任务的智能技术体系。

对当前而言, 深化系统融合以及打造通用智能, 好像是破解数据与算法双重困局可真正发挥效用之路径。然而, 业界心里明白, 从完成一个社区的运行, 跨越到能够主动适应千万家庭的状况, 其间存在的差距不容忽视, 或许得两条腿同步朝前行进: 一方面借助海量的数据去训练出泛化能力更为强大的模型, 另一方面于底层理论范畴探寻对物理世界表征的具有根本性质意义的突破。

安全与信任之间,“靠谱”很难

在2025年11月的时候, Figure AI公司之前的产品安全主管罗伯特·格伦德尔, 把在提交诉讼状给美国联邦法院时所披露的内容呈现了出来, 该内容称, 有一台Figure 02机器人在进行内部测试期间出现了故障, 并且其机械臂在不锈钢冰箱门上划出了一道凹痕, 这道凹痕有四分之一英寸那么深。

天津大学讲席教授、博士生导师孙涛提醒, 一台体重八九十斤的机器人, 一旦在家庭中发生倾倒, 即便感知和决策系统极为安全, 也存在可能对家庭成员构成危及的情况。

他向记者阐释了背后缘由, 当下多数人形机器人的机械臂运用高刚度位置控制模式, 电机被强行驱动至预设坐标。在家庭杂乱光线里, 一旦视觉感知产生厘米级误差, 机械臂便会凭借几十公斤的刚性冲击力撞向目标之外的物体。

陈毅豪所给出的解释是这样的情况, 大型人形机器人其肢体活动的范围是比较广泛的, 只是单单依靠预设的轨迹来进行运行, 完全没有办法感知到从后方以及侧方靠近过来的人和宠物, 如此一来是很容易发生磕碰从而导致对人造成伤害的事故的。

进入家庭的具身智能操控, 这是需要更加细腻精准的, 毕竟机器人“手脚”的可靠程度, 直接决定着它能不能被迎进家门, 能否被迎进家门取决于这个可靠程度。

孙涛所在的团队, 正在想着法子去模仿人体的肌肉以及筋腱, 采用一种更为轻巧的驱动方式, 去替换那笨重的电机直驱方式。借助仿生设计, 使得机器人在减轻自身重量的情况下, 还能提升负载能力, 从机械结构的层面, 增强物理安全性。

陈毅豪透露, 他所在的中心正在进行全域避障防护系统的研发工作, 这里面涵盖了覆盖机身的电子皮肤薄膜压力传感器, 一旦触碰就会马上停机, 另外还包含分布式薄膜超声波传感器, 其类似于汽车倒车雷达, 能够提前探测靠近的人或者物体, 并且主动减速, 从而从全方位保障人、机、物的安全。

另外, 他们把柔性电子以及电子皮肤技术作为基础, 去研发末端执行器, 这个末端执行器搭载了触觉感知功能, 如此一来便可以让机器人识别物体的物理属性, 像是冷热、光滑、粗糙这些, 进而能够自主地去判断抓取力度以及夹持角度, 从而破解了那种心有余而力不可逮, 也就是“想干活”却“干不好”的核心痛点。

信息安全门槛同样无法避开。从今年第三季度起, “拾光S1”机器人会分批次进入住户家里, 进而开启规模化运营。这极有可能是在全球范畴内首例通用人形机器人于真实家庭场景达成规模化部署。家庭属于私密空间, 迎进一个机器人, 无论其身份是“保姆”, 还是“护工”, 亦或是“小时工”, 这等于是接入了一个24小时在线的数据采集终端。当它采集数据时, 是否存在边界? 其边界又在何处?

陈盈盈觉得, 端侧智能处理这回事儿, 在不联网的状况之下, 会使得机器人的“大脑”在本地达成理解以及决策, 达成数据不出家门, 进而守住家庭数据隐私。

“将那机器人, 安全地交到普通家庭人的手里, 这就得于真实场景之中, 长期去验证, 长期去打磨, 这可是一件, 极为需要怀有敬畏之心的如此之事啊。”叶云是这般讲的。

清华大学助理教授、破壳机器人创始人许华哲, 当过星海图联合创始人兼首席科学家, 心态一直挺乐观, 他说工厂里那种重复单一的作业数据没法让机器人搞清真实世界的复杂状况, 家庭数据情况很复杂且多元, 这种非结构化环境恰恰是能培育出真正通用智能以及推动技术快速更新换代的最佳环境, 许华哲坚信家庭机器人在不久之后会真正出现, 从而重新界定人们的生活方式。