S²-VLA 引入信念状态和自适应动态门控,仅用2B参数、7GB显存,长程操控超越7B模型。 作者丨张 璐 编辑丨幸丽娟 过去一段时间,Scaling Law 在具身智能里被看得很重。为了让机械臂完成复杂的搬运、对准和组合,多数工作把视觉-语言-动作(VLA)模型做到 7B 甚至 8.5B。参数变大后,语义理解和场景识别确实更强了,但长程操控里的不稳定问题并没有随之消失。 很多大参数量 VLA 在执行到第 10 步或更后面时会出现突然失败。核心原因是累积误差放大(Cumulative Error Propagation):早期哪怕只有毫米级定位偏差,也会在后续步骤中逐步放大,最终导致抓取失败或动作中断。参数量大了,语义理解确实更强,但模型在动作后半程还是很难及时纠正偏差。 华东师范大学与上海交通大学团队提出的 S²-VLA 针对这个问题做了改进。工作由谢志鹏、韩宗益(共同一作)、赵静(通讯作者)和孙仕亮等完成。 他们没有继续堆参数,而是加了信念状态和自适应动态门控,让模型能按当前阶段调整注意力。结果是:2B 参数量的模型在 LIBERO-Long 上达到 96.4% 成功率,超过了多数…

Gemini 领跑,GPT表现平平,国立清华、英伟达提出双奖励孪生网络,告别算力焦虑。 作者丨张 璐 编辑丨幸丽娟 VLM大模型(VLM)在静态视觉与推理任务上已展现出强悍能力。然而在具身智能领域,当模型需要面对复杂的动态交互与机械臂控制时,它们能否准确评估智能体的动作与画面变化,依然是一个待检验的问题。 过去不少人以为,能“看懂画面”就意味着能“当好教练”。但对具身智能来说,从识别场景到精准评估动作进展,完全是两码事。 为了厘清各大模型在真实动作评估中的底细,国立清华大学与 NVIDIA 联合团队在最新研究《VLM-AR3L: Vision-Language Models for Absolute and Relative Rewards in Reinforcement Learning》中,把 Gemini 2.0、GPT-4.1 等主流大模型拉进同一个考场,对它们的视觉裁决能力做了一场综合评估。 论文链接:https://arxiv.org/pdf/2607.00483 01 考场设计:四大仿真套件、 10 大场景与“看图判进展”规则 研究团队选用的 10 个典型任务,涵盖了具…

给模型做一次脑部“CT”,低成本重塑真实空间智能。 作者丨张 璐 编辑丨幸丽娟 先来看一道简单的多模态大模型视觉考题: 观察给出的几张室内多视角照片,请回答:从图 1 的视角来看,蓝色椅面的办公椅右边是什么? A. 单人沙发以及旁边的一张小桌子 B. 摆着微波炉的桌子 C. 小厨房 D. 蓝色垃圾桶 Qwen2.5-VL-7B精准选择了正确答案 A;LLaVA-OneVision-8B却选了 D。 按照以往的习惯,我们大概率会把原因归咎于模型在做多视角坐标转换时逻辑迷航了,或者它的空间推理能力不够,把左右相对位置搞混了。 但中山大学团队却在论文《SpatialSV: Internalizing Interpretable 3D Spatial Awareness in MLLMs via Task-Oriented Visual Supervision》中,给出了一个意想不到的答案。 研究团队像给模型做脑部 CT 诊断一样,提取出 LLaVA 在推理生成时的中间隐藏层特征,渲染成了一张 3D 空间点云图。 瞬间真相大白:在 LLaVA 脑海里建构的三维几何画卷中,那张作为关键参照物的“…

The SPAC transaction values PlusAI, whose self-driving trucking software is already generating revenue, at about $800 million. The post PlusAI to take autonomous trucking public via a SPAC deal appeared first on The Robot Report.

2026年9月4日至8日,全球领先的具身智能公司魔法原子(MagicLab)将亮相IFA2026,完整呈现其"本体硬件、物理AI大脑、场景交付"三层全链路闭环能力,同时面向欧洲企业级市场战略聚焦柔性搬运与物流分拣两大高价值工业场景,展示其作为“端到端工业级具身智能解决方案提供商”的全球化竞争力。 在现场,专业观众与行业买家将有机会近距离观摩MagicBot D1与HyperBot的多机协同调度,并亲身体验Magic-VLA K02大模型的零样本泛化与抗干扰能力。此外,现场还将设置商务洽谈专区,供全球合作伙伴深入了解魔法原子的渠道政策与本地化售后支持体系。 新品亮相——三款新品登陆欧洲,本体矩阵覆盖全场景作业 魔法原子此次将带来三款2026年全新发布的机器人产品,构成覆盖“技术摸高—工业主力—轻量部署”的完整硬件梯队。 MagicBot X1作为旗舰级高动态全尺寸人形机器人,负责技术摸高、代表本体能力上限。相较于魔法原子上一代全尺寸通用人形机器人MagicBot Gen1,X1自研关节模组全线升级,膝关节峰值扭矩350N·m以上、极限扭矩最高450N·m,关键关节运动范围提升超50%;钛…

李飞飞的 Atlas 来了 一张照片能够告诉 AI,房间里有一张桌子。但如果把镜头移到桌子背后,那里应该是什么样?如果机器人伸手推动桌上的杯子,接下来又会发生什么? 识别物体、生成画面和理解空间,是相互关联、却不能直接画等号的能力。李飞飞创办的World Labs,正在尝试跨越它们之间的距离。 昨晚,World Labs 发布新一代世界模型 Atlas,这是一款全域模型,团队从零开始预训练,使其能够原生处理文本、图像、视频和 3D 数据。Atlas 它将用于后续 Marble 及其他产品,目前面向部分合作伙伴开放早期访问,而非全面上线。 这款备受关注的多模态世界模型的亮点是什么? 按照官方披露,Atlas的主要能力包括世界生成、重建和模拟等广泛任务: 可控运镜:Atlas 可利用像素级相机控制,从一张或多张图像生成图像和视频,输出长达 1 分钟的 1440p 视频。 空间重建:Atlas 可以根据一张或数十张输入图像重建真实世界场景。它既可以生成来自新视角的图像帧,也可以生成明确的 3D 输出,其性能优于目前最先进的 3D 重建专用模型。 时空模拟:Atlas 通过输入视频对空间和时间…

Unitree is setting up a “three bases, two centers” embodied-intelligence footprint in Chengdu, making it the fifth leading Chinese embodied-AI company to establish a presence in the southwestern tech hub.

China’s National Healthcare Security Administration has carved robot-assisted surgery into its own reimbursement group in the DRG/DIP 3.0 plan, closing a pricing gap that could otherwise penalize hospitals adopting surgical robots.

最近,一只只有 25 厘米高的机器鸭,意外把端侧 AI 的想象力拉到了聚光灯下。 Hugging Face 旗下 Pollen Robotics 发布的 Microduck,是一款售价 399 美元的开源双足机器人。它约 800 克重,开箱即可行走、坐下、踢球、抓取,摔倒后还能自己爬起来。更重要的是,它并不只是一个会动的玩具,而是一个面向开发者的开源机器人平台:用户可以在仿真环境中训练动作策略,再部署到真实机器人上。 这只“小鸭子”之所以引发关注,不只是因为它足够可爱、足够便宜,也不只是因为机器人终于开始进入普通开发者的桌面。它真正释放出的信号是:AI 正在从屏幕里的模型,走向会感知、会行动、会互动的实体设备。 过去几年,人们谈 AI,最常谈的是云端大模型、参数规模、训练集群和算力中心。但当 AI 开始进入真实世界,问题会变得非常具体:设备能不能本地响应?能不能离线运行?隐私数据能不能不上传?功耗和散热能不能被终端接受?成本能不能支撑规模化普及? 这些问题,正是端侧 AI 真正落地时必须回答的问题。 Microduck 给出的,是“小模型、小芯片、小机器人”的一种想象。一个低成本、开源…
端侧大模型推理35–40W、流畅控制需200W+,电池越重越费电,人形机器人卡死在"能用-重量-散热"的物理内环。工厂平面工位,可拆掉双足;换个环境,腿无可替代。



Direct Drive is pushing modularity into the robot body itself: multiple D1 units can physically join, and the system auto-recognizes the new configuration to rebuild its dynamics model for new loads and terrain.

在前序章节中,YAML 契约 已经证明了”形式化为代码的规矩在机器世界里长什么样“,同一份规则文件(YAML)能被编译为四种机器格式:放在 AI 指令前面的规则(Prompt 前缀)、给代码自动校验用的规则(JSON Schema)、给设计师走查用的清单(Checklist)、给自动化流水线用的拦截规则(CI 规则)。机器拿到这些格式后,能在AI生成界面之前自动拦住违规内容。 但这里有一个前提被忽略了:机器能执行规则,前提是规则本身写得对。如果规则的”原材料”设计规范,本身写的是”严重的用红色”这种机器读不懂的自然语言,那么再强大的编译管线也翻译不出精确的机器指令。 本文要回答的正是这个被忽略的前提:当设计意图需要被机器执行时,同样的意图,写成自然语言规范和写成规则文件字段,到底有什么实际差别?这个差别带来的能力是不是不可替代? 本文核心回答三个问题: ① 团队文档里写的”错误状态要分级”,机器能看懂吗? ② 同样的设计意图,写成自然语言规范和写成规则文件YAML字段,到底有什么实际差别? ③ 这个差别带来的能力是不是不可替代。 一、问题:同样的设计意图,写成自然语言规范和写成契约字段…

要闻提示 1.宇树机器狗隐秘灰产链曝光,改电池标签“偷渡”上飞机 2.罕见!小米华为发布时间撞档,网友:神仙打架 3.星宇股份董事长回应“解约应届生” 4.字节上调期权价格,涨幅约5% 5.月之暗面启动港股 IPO 流程,本周已向港交所秘密交表 6.燧原科技:科创板 IPO 网上发行最终中签率 0.02455315% 7.章泽天播客突然更新,透露曾经的职业梦想:做一个记者 8.人走茶凉?苹果官方社媒账号已取关库克:新CEO特努斯成苹果唯一关注 今日头条 宇树机器狗隐秘灰产链曝光,改电池标签“偷渡”上飞机 9月2日消息,有媒体曝光了宇树科技机器狗背后一条隐秘的灰产链。在二手交易平台上,部分机器人租赁商通过篡改宇树机器狗电池标签的方式,将高容量电池伪装成符合航空规定的“合规电池”,试图把产品“偷渡”上飞机。报道称,有商家撕下原厂印有421.2Wh额定能量的标签,换上自行打印的灰色假标签,将额定能量篡改为97.92Wh,同时伪造电压、充电限制等核心参数。 根据中国民航局规定,旅客携带的锂电池额定能量不超过100Wh的无需航空公司批准即可随身携带,超过100Wh但不超过160Wh的需经航空公司…

NexCOBOT, which provides functional safety and motion controllers, discusses how physical AI benefits from 'Big Tech' and where it will grow. The post NexCOBOT discusses physical AI market hurdles and acceleration appeared first on The Robot Report.

Rajat Bhageria, the founder and CEO of Chef Robotics, will explore what makes food such a demanding benchmark for physical AI. The post Learn why food is physical AI’s hardest problem at RoboBusiness appeared first on The Robot Report.

The $399 small-scale robot is the company’s second desktop robot, after Reachy Mini in 2025.

Caterpillar 与 FieldAI 合作开发面向工业现场与工厂的物理 AI、自主机器人与数字孪生系统,结合后者的机器人基础模型与英伟达加速计算、Omniverse 技术,早期应用包括自主巡检、态势感知与运营优化,应对劳动力短缺与产能压力。AI summary

China's robotics industry is changing the way it survives and operates.

The core business remains solid, but the second growth driver hasn’t worked yet.
Insider Brief Lyte has raised $165 million in Series C funding at a $1.6 billion post-money valuation as the physical AI perception company moves its sensing platform into production deployments. According to Lyte, Maverick Silicon led the round, with participation from Fidelity Management & Research Company, Atreides Management, Key1 Capital, Ora Global and other existing […]

Insider Brief American and Israeli startup Aitan has emerged from stealth with $41 million in new financing to expand development and international deployment of AI-powered robotic defense systems, bringing its total funding to $54 million. Deep33 and Dell Technologies Capital co-led the round, with participation from Gokul Rajaram, Benjamin Ling of Bling Capital and Kevin […]

李飞飞旗下 World Labs 发布全模态世界模型 Atlas,文本、图像、视频与 3D 数据统一锚定到三维空间位置;相机轨迹直接作为几何输入,可生成最长 1 分钟 1440p 视频,仅用 2-3 张照片即可重建真实场景,官方称超过专用 3D 模型。AI summary
