
The most actionable trade from these insights is the robot “brain” software layer, where value is shifting away from hardware makers. Private leader Ant Lingbo is betting on a pure robot-native foundation model, with its next-generation release expected in 2026 to power over 20 robot types—watch for IPO or partnership news as a catalyst. Public market exposure can be gained through robotics and AI-themed ETFs (e.g., BOTZ, ROBO) or by owning sensor and data-supply-chain leaders that benefit from the race to scale real-world robot data. The data bottleneck means companies with cost-effective, high-quality robot data collection capabilities could outperform as data volumes reach the hundred-thousand-hour milestone. Monitor Chinese robotics component stocks for near-term momentum, as China’s hardware and data collection advantages may accelerate the local brain model ecosystem.
• 公司定位:蚂蚁集团旗下的子公司,专注于研发机器人原生基础模型(即“机器人大脑”),目标是未来让不同品牌、不同形态的机器人都能运行灵波的模型。 • 核心理念:坚信机器人需要自己的、从物理世界原生出来的模型,而非在数字世界模型上修修改改。这被视为公司最大的“赌注”。 • 技术路线: * 不做本体:现阶段不涉足机器人硬件制造,专注于大脑(软件和模型)的研发,以实现跨本体的通用性。 * 从传感器和视频学习:坚持从真实传感器数据和视频中学习,让模型理解物理世界的动态、时序和空间关系。 * 巨身原生预训练:完全从物理世界的需求出发,重新设计并训练视觉和动作模型,而不是依赖为数字世界(如图像/视频生成)设计的模型。 • 产品迭代: * 第一代模型(2026年初发布):支持9种机器人构型,主要完成桌面上的简单抓取任务,仅控制双臂。 * 第二代模型(最新发布):包含6个模型,支持20多种构型,自由度扩展到头部、腰部、底盘甚至灵巧手。预训练数据量从2万小时提升至6万小时(经过更严格清洗后的有效数据量约为上一版的4倍)。 * 关键模型: * Limbo Vision & Limbo Depth:从几何角度(点、线、面)重新训练视觉模型,提升对物理空间的感知能力(例如,能“看到”玻璃门后的猫,并感知到玻璃的存在)。 * VLA 2.0:核心模型,融合了MOE(混合专家)架构和单向时间建模技术,专为机器人控制设计,处理随机性任务的能力大幅提升(例如,与人打桌球、整理被随机抛洒的桌面物品)。 • 数据策略: * 主要依赖真机数据和Ego(第一人称视角)数据,仿真数据主要用于评测。 * 认为真机数据采集成本在过去两年下降了至少三倍。 * 面临的核心挑战是如何平衡数据质量和可规模化采集,以及如何定义标准化的采集流程。
• 投资主题:具身智能(Embodied AI),特别是机器人“大脑”或基础模型领域,正在成为新的焦点。行业重心正从硬件本体向软件和智能层转移。 • 竞争格局:市场格局可能类似于大语言模型,最终由少数大厂和2-3家创业公司主导。蚂蚁灵波作为背靠大厂的创业公司,是一个值得关注的玩家。 • 核心壁垒: * 数据:高质量、可规模化的真机数据采集能力是关键瓶颈和护城河。中国在硬件供应链和数据采集上的优势被认为是重要的加速器。 * 技术路线:坚持“巨身原生”模型是一场豪赌,如果成功,将建立起与依赖数字世界模型的公司完全不同的技术壁垒。 • 发展阶段判断: * 行业整体仍处于非常早期的阶段,被比作大语言模型的GPT-1时刻之前。主要瓶颈在于机器人数据的规模远不及互联网数据。 * 目前大脑的发展落后于本体,但进步速度快于预期。行业正从实验室Demo走向实际的工业、物流等落地场景。 • 未来催化剂: * 数据规模化:当机器人原生数据达到十万小时乃至百万小时级别时,可能迎来智能的突破。 * 灵巧手与触觉传感器:硬件的发展将推动机器人执行更复杂、精细的任务,并对模型提出新需求。 * 落地场景明确:找到能大规模商业化的应用场景,将反向驱动模型和本体的迭代。
• “大脑”与“本体”分离:2026年的新现象是,越来越多公司专注于做机器人大脑,而不做硬件本体。这与此前软硬一体的模式形成对比。 • 大脑发展滞后于本体:当前行业的主要矛盾是机器人不够智能,因此资源更多地向大脑研发倾斜。未来大脑和本体会交替上升,互相提出新的需求。 • 硬件加速成熟:灵巧手、触觉传感器等硬件发展迅速,供应链逐渐成熟,为更复杂的任务执行提供了基础。 • 从Demo到落地:行业焦点从每年展示一个新Demo(如倒咖啡、叠衣服),转向在工厂、物流等真实场景中解决实际问题。
• 产业链机会:关注机器人“大脑”模型公司(如蚂蚁灵波)的同时,也应关注其上游的数据采集和下游的特定场景应用公司。 • 硬件迭代风险:当前一代的机器人硬件(尤其是传感器)可能无法完全适配下一代模型的需求。未来可能会出现由智能模型定义的新一代硬件公司,对现有硬件厂商构成挑战。 • 中美差异:美国公司(如Generalist, Physical Intelligence)在数据规模和预训练上起步更早。中国公司的潜在优势在于强大的硬件供应链和快速的数据采集能力,这可能在数据积累的“窗口期”实现赶超。
• Physical Intelligence (PI):美国机器人大脑领域的明星实验室,被比作机器人界的OpenAI。更强调零样本(zero-shot)能力,希望模型无需后训练就能完成各种任务。 • Generalist:另一家美国前沿公司,更注重高效后训练,即让模型通过少量数据快速学习新任务。在利用UMI数据方面有深入理解,数据规模可能已达数十万甚至百万小时。
• 技术路线差异:PI追求通用性,Generalist追求实用性,但两者最终可能殊途同归。这代表了当前具身智能模型发展的两种主要哲学,投资者需理解不同路线的潜力和风险。 • 数据获取方式:PI更侧重于真机遥操作数据,Generalist对特定数据(UMI)理解更深。随着灵巧手和第一人称视角(Ego-centric)数据的兴起,数据获取方式可能发生变革,影响不同公司的竞争优势。

By 张小珺
努力做中国最优质的科技、商业访谈。 张小珺:财经作者,写作中国商业深度报道,范围包括AI、科技巨头、风险投资和知名人物,也是播客《张小珺Jùn | 商业访谈录》制作人。 如果我的访谈能陪你走一段孤独的未知的路,也许有一天可以离目的地更近一点,我就很温暖:)