147. 和蚂蚁灵波沈宇军聊:机器人原生基础模型、大脑和本体的关系、预训练与数据scale up、老师汤晓鸥
147. 和蚂蚁灵波沈宇军聊:机器人原生基础模型、大脑和本体的关系、预训练与数据scale up、老师汤晓鸥
Podcast1 hr 52 min
Listen to Episode
Note: AI-generated summary based on third-party content. Not financial advice. Read more.
Quick Insights

The most actionable trade from these insights is the robot “brain” software layer, where value is shifting away from hardware makers. Private leader Ant Lingbo is betting on a pure robot-native foundation model, with its next-generation release expected in 2026 to power over 20 robot types—watch for IPO or partnership news as a catalyst. Public market exposure can be gained through robotics and AI-themed ETFs (e.g., BOTZ, ROBO) or by owning sensor and data-supply-chain leaders that benefit from the race to scale real-world robot data. The data bottleneck means companies with cost-effective, high-quality robot data collection capabilities could outperform as data volumes reach the hundred-thousand-hour milestone. Monitor Chinese robotics component stocks for near-term momentum, as China’s hardware and data collection advantages may accelerate the local brain model ecosystem.

Detailed Analysis

蚂蚁灵波科技 (Ant Lingbo Technology)

公司定位蚂蚁集团旗下的子公司,专注于研发机器人原生基础模型(即“机器人大脑”),目标是未来让不同品牌、不同形态的机器人都能运行灵波的模型。 • 核心理念:坚信机器人需要自己的、从物理世界原生出来的模型,而非在数字世界模型上修修改改。这被视为公司最大的“赌注”。 • 技术路线: * 不做本体:现阶段不涉足机器人硬件制造,专注于大脑(软件和模型)的研发,以实现跨本体的通用性。 * 从传感器和视频学习:坚持从真实传感器数据和视频中学习,让模型理解物理世界的动态、时序和空间关系。 * 巨身原生预训练:完全从物理世界的需求出发,重新设计并训练视觉和动作模型,而不是依赖为数字世界(如图像/视频生成)设计的模型。 • 产品迭代: * 第一代模型(2026年初发布):支持9种机器人构型,主要完成桌面上的简单抓取任务,仅控制双臂。 * 第二代模型(最新发布):包含6个模型,支持20多种构型,自由度扩展到头部、腰部、底盘甚至灵巧手。预训练数据量从2万小时提升至6万小时(经过更严格清洗后的有效数据量约为上一版的4倍)。 * 关键模型: * Limbo Vision & Limbo Depth:从几何角度(点、线、面)重新训练视觉模型,提升对物理空间的感知能力(例如,能“看到”玻璃门后的猫,并感知到玻璃的存在)。 * VLA 2.0:核心模型,融合了MOE(混合专家)架构和单向时间建模技术,专为机器人控制设计,处理随机性任务的能力大幅提升(例如,与人打桌球、整理被随机抛洒的桌面物品)。 • 数据策略: * 主要依赖真机数据Ego(第一人称视角)数据,仿真数据主要用于评测。 * 认为真机数据采集成本在过去两年下降了至少三倍。 * 面临的核心挑战是如何平衡数据质量和可规模化采集,以及如何定义标准化的采集流程。

关键洞察与投资启示

投资主题具身智能(Embodied AI),特别是机器人“大脑”或基础模型领域,正在成为新的焦点。行业重心正从硬件本体向软件和智能层转移。 • 竞争格局:市场格局可能类似于大语言模型,最终由少数大厂和2-3家创业公司主导。蚂蚁灵波作为背靠大厂的创业公司,是一个值得关注的玩家。 • 核心壁垒: * 数据:高质量、可规模化的真机数据采集能力是关键瓶颈和护城河。中国在硬件供应链和数据采集上的优势被认为是重要的加速器。 * 技术路线:坚持“巨身原生”模型是一场豪赌,如果成功,将建立起与依赖数字世界模型的公司完全不同的技术壁垒。 • 发展阶段判断: * 行业整体仍处于非常早期的阶段,被比作大语言模型的GPT-1时刻之前。主要瓶颈在于机器人数据的规模远不及互联网数据。 * 目前大脑的发展落后于本体,但进步速度快于预期。行业正从实验室Demo走向实际的工业、物流等落地场景。 • 未来催化剂: * 数据规模化:当机器人原生数据达到十万小时乃至百万小时级别时,可能迎来智能的突破。 * 灵巧手与触觉传感器:硬件的发展将推动机器人执行更复杂、精细的任务,并对模型提出新需求。 * 落地场景明确:找到能大规模商业化的应用场景,将反向驱动模型和本体的迭代。


机器人行业趋势

“大脑”与“本体”分离:2026年的新现象是,越来越多公司专注于做机器人大脑,而不做硬件本体。这与此前软硬一体的模式形成对比。 • 大脑发展滞后于本体:当前行业的主要矛盾是机器人不够智能,因此资源更多地向大脑研发倾斜。未来大脑和本体会交替上升,互相提出新的需求。 • 硬件加速成熟:灵巧手、触觉传感器等硬件发展迅速,供应链逐渐成熟,为更复杂的任务执行提供了基础。 • 从Demo到落地:行业焦点从每年展示一个新Demo(如倒咖啡、叠衣服),转向在工厂、物流等真实场景中解决实际问题。

关键洞察与投资启示

产业链机会:关注机器人“大脑”模型公司(如蚂蚁灵波)的同时,也应关注其上游的数据采集和下游的特定场景应用公司。 • 硬件迭代风险:当前一代的机器人硬件(尤其是传感器)可能无法完全适配下一代模型的需求。未来可能会出现由智能模型定义的新一代硬件公司,对现有硬件厂商构成挑战。 • 中美差异:美国公司(如Generalist, Physical Intelligence)在数据规模和预训练上起步更早。中国公司的潜在优势在于强大的硬件供应链和快速的数据采集能力,这可能在数据积累的“窗口期”实现赶超。


国际对标公司

Physical Intelligence (PI):美国机器人大脑领域的明星实验室,被比作机器人界的OpenAI。更强调零样本(zero-shot)能力,希望模型无需后训练就能完成各种任务。 • Generalist:另一家美国前沿公司,更注重高效后训练,即让模型通过少量数据快速学习新任务。在利用UMI数据方面有深入理解,数据规模可能已达数十万甚至百万小时。

关键洞察与投资启示

技术路线差异:PI追求通用性,Generalist追求实用性,但两者最终可能殊途同归。这代表了当前具身智能模型发展的两种主要哲学,投资者需理解不同路线的潜力和风险。 • 数据获取方式:PI更侧重于真机遥操作数据,Generalist对特定数据(UMI)理解更深。随着灵巧手和第一人称视角(Ego-centric)数据的兴起,数据获取方式可能发生变革,影响不同公司的竞争优势。

Ask about this postAnswers are grounded in this post's content.
Episode Description
进入2026年,中国科技业萌生了一个新现象:出现一批从机器人大脑出发的公司,现阶段重心不在本体上。这个现象是反直觉的——过去,大家认为,硅谷机器人团队更专注大脑研究,中国机器人团队更专注硬件和本体。 在我们上集节目中,我访谈了Physical Intelligence(Pi)研究科学家柯丽一鸣。Pi是一家在硅谷做机器人大脑的备受瞩目的实验室。业内人士把它们比作机器人的OpenAI。 今天我邀请的是一位在本土探索原生具身基模的公司,是由蚂蚁集团孵化的子公司蚂蚁灵波,目前刚发布第二代具身基础模型。 我与首席科学家沈宇军聊了聊,如何从预训练开始训一个机器人模型?瓶颈是什么?机器人的GPT-1 moment在哪里?——大家也能从中感受一些中美思路的融合与差异。 接下来,就是我对沈宇军的访谈。 OUTLINE: 00:02:03 蚂蚁灵波的缘起 人工智能学生的一段迷茫与辗转 从字节跳动到蚂蚁研究院 蚂蚁成立子公司蚂蚁灵波做具身智能始末 00:16:03 做机器人的原生大脑 为什么决定从大脑开始? 通用意味着跨本体、跨场景、跨任务 24年底成立以后,25年、26年bet了什么? 25年:从真实传感器出发解决问题 26年:既然没办法push数字世界修改模型,基于物理世界的需求重做一遍 预训练准备数据核心是:1、你要下发什么样的任务,2、拿到数据以后怎么处理更干净 这次发布的6个模型和他们的关系(Depth、Vision、VLA、Video、World、VA 2.0) 但更本质的智能我们还没解决:把和人的交互考虑进去 做具身大脑之后,处理位置随机问题的能力强了很多 机器人泛化性的迹象到底出现了吗? 01:07:29 数据没有scale up是最大卡点 具身智能还没有到GPT-1时刻,因为没有看到比较好的做数据scale up的方式 当具身数据和互联网数据能达到相同量级,可能才到GPT-1时刻,我预计明年中 发完第一代模型我们就意识到,强行在数字模型上魔改不work 硅谷两家机器人大脑公司 :Physical Intelligence强调zero shot,Generalist强调后训练 随着灵巧手的成熟,真机遥操作和UMI(Universal Manipulation Interface,通用操作接口) 两条数据采集路线可能变化 细数2024-2026年具身智能全行业的发展与速度 行业发展不及预期的仍是数据,需要百万小时起步的数据量 01:23:10 机器人大脑与本体的关系 为什么不做本体?本体很难通用,如果场景选不准,本体设计有问题 现在大脑的开发落后于本体,未来大脑和本体一定交替上升 这一代的硬件不一定能够迭代去适应下一代的模型,尤其是传感器 接下来的几代机器人基座模型会如何迭代? 01:31:48 创业是赌出来的、与蚂蚁的关系、汤晓鸥 下过的“赌注”? 蚂蚁如何管理蚂蚁灵波? 最好的预期和最坏的预期? 最终的产业格局?也许贴近大语言模型的格局 你对人形机器人有执念吗? 没有! 当下的核心任务只有一个:智能不够! 我的老师汤晓鸥 LINKS: 我们的播客在小宇宙、Apple Podcast、Spotify等全音频平台播出; 我们的视频播客在Bilibili、小红书、视频号、抖音等全视频平台播出; 如果你想服用文字版,请搜索我们工作室的公众号:语言即世界language is world。 DISCLAIMER: 本内容不作为投资建议。 CONTACT: xiaojunzhang@lisw.ai Jump into the new world-and explore with us!😉
About 张小珺Jùn|商业访谈录
张小珺Jùn|商业访谈录

张小珺Jùn|商业访谈录

By 张小珺

努力做中国最优质的科技、商业访谈。 张小珺:财经作者,写作中国商业深度报道,范围包括AI、科技巨头、风险投资和知名人物,也是播客《张小珺Jùn | 商业访谈录》制作人。 如果我的访谈能陪你走一段孤独的未知的路,也许有一天可以离目的地更近一点,我就很温暖:)