当大语言模型化身为智能体走向真实世界,它们面临的困境,与十年前在十字路口指挥交通的强化学习模型如出一辙。 作者丨岑峰 幸丽娟 编辑丨岑峰 在通往 AGI 的浪潮中,基础模型智能体(Foundation Model Agents)正以前所未有的速度接管各种任务。业界曾普遍乐观地认为,凭借大模型海量的预训练知识,智能体可以无缝适应各种真实场景。 但在现实中,当我们将一个在英文语境下表现完美的智能体,切换到中文或低资源语言环境中时,其错误率往往会呈现断崖式上升。 这种环境切换带来的“智力降级”,真的是大模型时代特有的新问题吗? 在正在进行的 2026 年的德国不莱梅 IJCAI大会的 Early Career Spotlight(早期职业焦点)环节,亚利桑那州立大学(ASU)助理教授魏华给出了一个极具启发性的“降维”视角:今天大模型智能体所面临的脆弱性,本质上与传统强化学习(RL)在物理世界中遭遇的“仿真到现实(Sim-to-Real)”差距如出一辙。 作为长期深耕强化学习与真实世界决策的学者,魏华教授早年曾在腾讯 AI Lab 担任研究员,后于新泽西理工学院和 ASU 任教。早在2017 …
宇树的下一张牌,是搭起一套系统,让全球 AI 的持续进步,转化为机器人不断加快的进化速度。 作者 | Li Yuan 8 月 19 日,宇树科技正式登陆科创板。上市首日,公司股价一度较发行价涨超 6 倍,总市值突破 4400 亿元。 当市场盯着这家「机器人身体最强公司」的股价时,一个更重要的问题随之出现:获得更多资金和资源之后,宇树接下来要做什么? 当天中午,王兴兴参加了宇树的上市答谢午宴。这几乎是公司上市后的标准动作:感谢一路支持的政府、股东和合作伙伴,再回望一遍创业十年的艰辛。 但在略显磕巴地完成这些常规致谢后,王兴兴没有就此结束,而是突然把话题转向技术,开始讲述宇树上市后真正准备投入的一套系统。 他的状态也随之变化。表达明显流畅起来,语速越来越快,从大模型讲到自动编程,从仿真训练讲到真机测试,再讲到机器人技能的自我进化。 显然,这部分内容他已经想了很久。 01 当 AI 进入机器人研发全过程 王兴兴讲的并不是宇树即将发布的某个模型或产品,而是他对机器人技术下一阶段的判断:只做一个 AI 模型或者视频模型,整体竞争力和迭代速度已经不够。下一阶段真正重要的,是能否把模型、工具、仿真、…
具身智能产业关注的重点正从“能力涌现”进入“生产力兑现”阶段,拼的不只是单一模型能力。8 月 19 日下午,在北京举行的 2026 世界机器人大会上,百度集团副总裁袁佛玉表示,机器人从“会展示”到“能上岗,需要模型、数据与应用协同形成的系统能力。 百度集团副总裁 袁佛玉 模型从理解语言,走向理解和预测物理世界 机器人真正进入物理世界,仅理解语言并不够,还要理解物体关系、动作后果及环境变化。随着 VLA、世界模型和运动控制加速演进,计算工程系统也面临更高要求。 袁佛玉指出,依托百度百舸 AI 计算平台,百度智能云持续完善面向具身智能的 AI Infra,支持企业完成从数据处理、模型训练、仿真评测到真机推理部署的研发全流程,推动模型从研究原型走向工程系统;在部分合作中,单步推理延迟已进入百毫秒以内区间。 数据从训练材料,变成具身智能最核心的生产要素 具身数据采集成本高、标准不一,且与具体本体、任务和环境高度相关。 袁佛玉认为,未来的重要竞争要素,在于企业积累了多少有效任务小时、捕获了多少高价值失败样本,以及形成了多少能够回流训练的数据。相比重复完成同一动作,失败、纠正、人工接管和边界案例数…
当 AGI 的大脑决定向边缘迁徙,英伟达拿出了统治机器人进化的“终极剧本”。 编辑丨岑峰 2026 年,大模型行业正经历一场前所未有的“体感位移”。那个在纯数字世界几乎无往不利的 Scaling Law,在试图跨越到物理世界时,正遭遇物理规律、空间约束和长尾数据的残酷审判。 AI 行业最核心的矛盾正日趋明显:云端算力的指数级爆发,与机器人终端落地的步履蹒跚,构成了一种日益撕裂的鸿沟。 这种割裂感,在 7 月悉尼 RSS 2026的最后一天,被推向了最高潮。在 “Robot World Models(机器人世界模型)” Workshop 上,传统机器人学界对物理因果的“敬畏”,正与 AI 工业界对规模效应的“迷信”正面交锋。 就在这场范式撞击的火山口上,英伟达物理AI专家Max Li,为我们拆解了其新发布的重量级产品——Cosmos 3。 这不再仅仅是一个更逼真的视频生成器:它是全球首个在同一个 Transformer 架构下,彻底打通了文本、视觉、音频和动作全模态的世界基础模型。如果说过去两年的具身智能还处于“组装机”时代:开发者需要吃力地将视觉模型、语言模型和控制算法像乐高一样拼凑在…
从“像素导演”转向“具身大脑”:RSS 2026“机器人世界模型”专题现场见证,想象力正在终结具身智能的“数据暴政”。 编辑丨岑峰 2026 年 7 月的悉尼,RSS 会场内,一种复杂的情绪正在蔓延:一半是火焰,一半是海水。 火焰来自于大模型在云端的持续狂飙,海水则来自于具身智能在现实落地中的“物理阵痛”。 在此之前,全球 AI 行业笃信一套名为“暴力美学”的成功公式:巨大的参数量 + 几乎无穷的互联网数据 = 涌现的智能。 这一公式在处理文本、图像甚至是视频生成时无往不利。但当人们试图将这套逻辑直接“平移”到机器人身上,让 AGI 进入物理世界时,那道无形却坚硬的“物理之墙”出现了。 在云端,数据可以被无限次复制和合成;但在物理世界,每一次机械臂的抓取、每一次足式机器人的迈步,都受限于时间的线性和物理空间的约束。 当“暴力美学”撞上“物理硬墙”,那个在数字世界里几乎无所不能的 Scaling Law,在试图拧开一个生锈的螺丝钉或在杂乱的厨房里寻找一只空气炸锅时,表现出了令人沮丧的笨拙。 AI 行业最核心的矛盾已经转移:我们需要机器人像人类一样,拥有在行动前进行“想象”的能力。 在 R…
斯坦福团队提出:机器人不需要见过所有的失败,它只需要学会如何“脑补”另一种可能。 作者丨岑峰 在 AGI 的数字版图里,大语言模型仅靠“读遍互联网文本”就拼凑出了通往智能的通途。这种由 Scaling Law 带来的暴力美学,让整个具身智能行业在过去两年里陷入了一种盲目的“数据崇拜”:人们坚信,只要像训练大模型一样,喂下数以百万小时的视频,机械臂就能在物理世界中无所不能。 而在2026 年的悉尼 RSS 大会,AI科技评论注意到,越来越多的研究者开始讨论,物理世界的数据获取具有时间和空间的“不可逆性”——文本可以被瞬间复制亿万次,但机械臂抓取一次杯子,在物理时空中就必须实打实地消耗数秒。更致命的是长尾效应:摩擦、形变、流体……人类根本不可能通过穷举法,去收集齐机器人面临的所有场景。 来自斯坦福大学李飞飞实验室的 黄文龙(Wenlong Huang),在“Data-Centric Robotics”主题Workshop的演讲中给出了一个“降维打击”式的解法:抛弃对海量“演示数据”的死记硬背,转向“反事实推理”与“脑内搜索”。 作为近年具身智能领域的明星学者,黄文龙的名字此前因 VoxPo…
MOSS-VL是一个将实时交互(边感知边说话)作为一等能力的开源视觉语言模型家族,通过门控交叉注意力让语言解码器在生成时同步处理视觉输入。MOSS-VL-Realtime在四个流式基准中平均成绩居开源模型之首(三项第一、一项第二),在OmniMMI Proactive Alerting上以66.0分大幅领先最佳基线(37.5分)。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsyhyrd60wg3roz03o05ne6l
作者|李苏 编辑|靖宇 8 月,乌兰察布。 近 30 位来自核心车企和方案商的智驾关键力量,被请进了阿里巴巴数据中心。 这里承载着中国智能驾驶研发 60% 的算力。数据中心昼夜不停,像一颗强健搏动的心脏;而道路上智能驾驶的车辆每一次从容的转弯、精准的刹停、安稳的跟车,背后都可能是这里彻夜的计算。几乎所有参会者正在训练的模型,就跑在脚下这片机房里。 把论坛开在数据中心所在地,本身就是一个信号: 智驾的竞争,已经从算法下沉到工程。 阿里云智能集团资深副总裁、公共云事业部总裁刘伟光的开场白很简短—— 模型、芯片、云,这三样东西过去由三类供应商分别提供 ,在三种不同的会上讨论。 这一次,它们被放在同一张桌上,由同一批决策者一起追问。 没有人再争论车企要不要上云,问题变成了:当智驾进入大模型时代,中国车企需要什么样的基础设施?谁能把芯片、云、模型三层都做通,而不是只卖其中一层? 阿里云给出的答案,是一条产线——从数据到模型再到算力,完整打通。 阿里巴巴在乌兰察布的数据中心之一|图片来源:阿里云 01 问题在下沉 如今,智驾的路线正在分化。 端到端已成共识,但再往上,有人押注 VLA,有人赌世界模…
Robotics foundation models have made remarkable progress. Today's best systems can follow natural language instructions to pick, place, sort, and manipulate a... Robotics foundation models have made remarkable progress. Today’s best systems can follow natural language instructions to pick, place, sort, and manipulate a wide variety of objects. But as these models grow more capable, evaluating them rigorously has become one of the field’s hardest unsolved problems. In this blog post, we introduce…
General Intuition is betting millions of hours of video game data can train the foundation models for physical AI, making it easier to build smarter robots with minimal real-world data.
Quick glossary for readers new to VLA/WAM terminology VLA Vision-Language-Action model: a robot policy that starts from a pretrained VLM backbone and adapts it... Quick glossary for readers new to VLA/WAM terminology VLA Vision-Language-Action model: a robot policy that starts from a pretrained VLM backbone and adapts it to generate actions from visual observations and language instructions. Large-scale VLM pretraining is a core part of the recipe. See Pi-0 and GR00T N1. WAM World-Action Model: …