Insider Brief Perceptron AI has released Isaac 0.5, a 36-billion-parameter open-weight model designed to combine video understanding, embodied reasoning and robot control in a single system. According to the Washington-based company, Isaac can analyze video, follow language instructions, locate and track objects, estimate the state of a task and generate robot actions. Robotics and automation […]

2020 年底,李柏依在康奈尔大学的博士生涯进入第三年,也走进了一段研究上的困顿期。 此前,她一直从事表征学习研究,但在那段日子里,她越往前走,似乎越不知道这条路还能通向哪里。也就是在那段时间,她开始接触多模态学习。当时,多模态还不是视觉研究的主流热点,三维视觉吸引了更多关注。她向同学说起自己正在做多模态,得到的反应往往礼貌而寡淡。 但她隐约觉得,当时按照固定类别完成检测和分割的视觉系统太“死”了:输入是预设的,输出也是预设的,像功能机上的实体按键,只能完成事先规定好的操作。有没有可能像智能手机一样,让输入变得任意,让视觉系统根据人的意图灵活地理解世界? 这个问题把她引向视觉与语言的对齐,也让她恰好赶上了 CLIP 发布后多模态研究爆发的前夜。 几年后,多模态已经成为 AI 领域最核心的方向之一。李柏依也从那个“不知道该往哪里走”的博士生,成为英伟达研究院和加州大学伯克利分校的研究员与研究负责人,带领团队推进 Foundation Motion,探索机器能否通过运动理解物理世界。 她的研究从计算机视觉出发,经过多模态学习,延伸到自动驾驶和具身智能。应用场景不断变化,贯穿其中的问题却始终…

具身智能浪潮下,产品经理如何转型?唐沐以咖啡机器人为例,强调机器人必须从“造出来”走向“用起来”,回归场景、数据与ROI。本文从设计、产品到硬件创业的实战视角,解析PM如何成为全栈Builder,并重新定义考核标准。 在 2026 AI产品大会现场,影智科技(XBOT)创始人兼CEO唐沐老师从设计、产品、互联网软件和智能硬件的职业经历讲起,讨论产品经理如何进入具身智能领域。他以扫地机器人、咖啡机器人和真实商业点位为例,说明机器人要从“造出来”走向“用起来”,必须回到场景、数据、运营和 ROI,并提出 AI 正在把传统 PM 推向全栈 Builder。 以下内容根据现场音频和演示材料整理,Enjoy: 一、每一次换赛道,都是重新学习产品 我先从自己的经历讲起,因为我后来对具身智能的判断,不是凭空来的,而是一次次换赛道逼出来的。 我大学学的是应用数学,毕业以后却去做设计师。现在听起来很自然,但在 2003 年前后,设计师还常常被叫作美工。我在金山做了两年,后来加入腾讯。当时腾讯还不到 200 人,我也赶上了互联网产品快速生长的阶段。 在腾讯的十年里,我做的一件重要事情,是把交互设计、用户研…

Pulling bad parts by hand dates back to 1960s assembly lines. I built a local defect detector using a webcam, RF-DETR, and a desktop robot arm. Ten training photos and 0.2 seconds per frame run the full detect, decide, pick, and verify loop right on my desk.

当具身智能风口再起,诺亦腾机器人CEO戴若犁选择了一条与众不同的路:以人为中心的数据采集。从动作捕捉到数据工厂,他如何用跨本体复用的数据体系,为物理AI铺路?本文深度对话戴若犁,揭秘数据采集赛道的商业逻辑与创业心法。 PART 01 天真的创业者 大概半年前,戴若犁博士开始写美食笔记。不是寥寥几句的赞美,一篇笔记动辄几千字。 他会详实记录各种美味的细节。 比如香港的菠萝油。他会描写面包体如何松软、糖壳如何酥脆不掉渣。吃的时候,温热面包夹上冻过的黄油,趁黄油没化冻时大口咬下,以咬掉半块黄油为佳。随后务必快速咀嚼和吞咽,才能感受温度和口感的双重冲突。 深圳蛇口胜记餐厅的那碗猪油拌饭:大米是滚烫的、煮得略干的,应该是优质东北大米或者日本珍珠米,泛着珠光的饱满;猪油必须是嫩油,会留有一些油渣,增加酥脆口感;拌饭酱油用的是头抽。大口咽下,味蕾瞬间满足。 戴若犁在朋友圈里分享的街头美食 从餐厅、到背后的人和故事,他都娓娓道来。美食只是锚点,他真正想要留住的“数据”是关于故人的回忆。这听起来像是一位中年人的念旧。经历过几轮技术浪潮的他,确实也不算是年轻人了。 但如果你知道他的身份——诺亦腾机器人创始…

只需手机“碰一下”,就能租借机器人,甚至让它跳舞表演? 8月28日,全国首家“碰一下”机器人租赁体验店在上海徐汇区新六百YOUNG商场焕新开业。该店由宇树科技核心生态伙伴具深科技旗下品牌“机时租”接入支付宝“碰一下”能力打造,实现线下机器人“碰一下”快捷租赁,并支持“碰一下”唤醒AI智能体操控机器人动作。活动当日,普通市民可实现零门槛沉浸式感受“一碰即控”的机器人互动乐趣。 开业当天,“机时租”联合支付宝发起 “碰一下”机器人痛楼答题闯关活动。顾客在商场内找到部署好的多台宇树机器人,用手机“碰一下”参与答题挑战,每通过一关就有机会获得操控机器狗的体验奖励,三关全过还能解锁隐藏福利,到店观看机器人群舞表演。 市民刘先生体验过后兴奋表示:“在机时租具身智能体验店的体验感拉满了!碰一下支付后就能指挥它做动作,感觉自己跟机器人的距离拉近了!”另据店内工作人员介绍,消费者体验结束,还能用支付宝“碰一下”直接完成支付,把心仪的机器人租回家。 据悉,支付宝“碰一下”已于今年7月完成AI升级,目前覆盖4亿用户、2300余家生态服务商、超3000万线下AI触点,构建起了全球首个大规模线下AI经营网络。 …

谁不想在新年到来之际收到一只可爱的 AI 机器鸭呢? 距离 2026 年圣诞节还有四个月,在英伟达以约 129 亿美元收购消息曝光次日,AI 开源社区 Hugging Face 发布了一款名为 Microduck 的小机器人。它身高 25 厘米、重不足 800 克。演示视频里,它用喙叼着袜子摇摇晃晃地走路,被人推搡时会尽力稳住,即便倒下也能自己爬起来,甚至可以穿上轮滑鞋滑旱冰。 产品售价 399 美元(约合 2,700 元人民币),有奶油白、石墨灰、薰衣草紫、天空蓝四种配色可选,附赠一只游戏手柄。联合创始人克莱姆·德朗(Clem Delangue)在社交平台 X 上放出一段 50 秒的演示视频,几个小时内浏览量接近 40 万。 (来源:Pollen Robotics) 从语音互动,到“走”进真实世界 做开源大模型托管平台起家的 Hugging Face,入局具身智能的节点要追溯到 2024 年初,前特斯拉(Tesla)Optimus 团队科学家雷米·卡德内(Rémi Cadene)加入,主导开源机器人库 LeRobot 的开发;2025 年 4 月,Hugging Face 完成对法国…

arXiv:2608.17512v2 Announce Type: replace Abstract: Although Large Vision-Language Models (VLMs) have significantly advanced embodied navigation, their direct deployment remains challenging, as existing methods often force VLMs into unnatural action spaces that misalign with their 2D pre-training priors, compounded by rigid reasoning schedules and inefficient memory management. To overcome these limitations, we propose TAMP-Nav, a unified framework for efficient embodied navigation. First, we in…
arXiv:2608.27371v1 Announce Type: new Abstract: This paper introduces Embodied Scene Rearrangement Planning (ESRP), a novel task requiring embodied agents to rearrange furniture in 3D scenes to match a target configuration using only egocentric observations and a top-down target layout. Unlike prior rearrangement tasks, ESRP precludes global state access and introduces mutual object occlusions, reflecting the practical constraints of real-world robotic deployment. These factors make aligning par…
arXiv:2608.27033v1 Announce Type: new Abstract: We introduce Riemann-1.0, a fully causal autoregressive World Action Model for embodied intelligence. Riemann-1.0 jointly models multi-view visual observations, robot states, and embodiment-specific actions within a unified causal autoregressive sequence, representing robot actions and world evolution as causal state transitions. Unlike existing WAMs based on joint generation, video-first prediction, or decoupled modeling paradigms, Riemann-1.0 uni…
arXiv:2608.26947v1 Announce Type: new Abstract: Embodied agents need environments that are visually diverse, physically interactive, and changing over time. Procedural simulators can generate large interactive scene collections, and recent 4D generators produce compelling visual dynamics. Combining these properties in one environment, however, still demands extensive manual effort, and the result is rarely editable or controllable enough to reuse at scale. We present 4DSynth, a controllable proc…

站在 2026 年 8 月北京世界机器人大会(WRC)的展馆中心,如果你闭上眼,听到的不再是两年前那种对“机器人像人一样跳舞”的惊呼,取而代之的,是从业者们在心里拨动算盘,计算 ROI(投资回报率)的声音。 具身智能正在经历一场从“秀肌肉”到“翻账本”的集体变轨。 回看这半年的轨迹,这种趋势演进得极具层次感: 5 月的维也纳 ICRA,学术界和产业界第一次如此默契地把所有火力都集中在了 VLA(视觉-语言-动作)模型上,那是具身智能的“物理学补课期”; 7 月初的上海 WAIC,200 多家具身智能企业同台竞技,集体把演示从“后空翻”换成了“拧螺丝、叠衣服”,那是行业的“场景落地焦虑期”。 7 月底的悉尼 RSS,开源硬件、仿真工具链和遥操作数据方案成为主角,行业开始为“大脑聪明、身体廉价、数据贫瘠”搭建公共底座,那是产业的“基础设施奠基期”。 而在 8 月的北京 WRC,所有话题似乎都围绕工程约束和商业底线展开。在这里,没人关心你的模型是否有哲学意义上的“意识”,大家只盯着三个指标:多少钱?多稳?跑一个月能省几个人的工资? “以前我们聊的是什么时候 AGI,现在我们在聊这台机器人跑一…

XPeng debuts the first major upgrade to its second-generation VLA, adding dynamic 4D spacetime understanding and bringing Robotaxi-grade L4 behavior to production cars.

从公寓送餐机器人的糟糕体验到烧烤店穿串场景的技术瓶颈,两个真实案例揭示了具身智能行业PM价值闭环缺失的现状。本文深入分析技术天花板与产品设计基本功的双重挑战,并探讨PM价值建立的条件与当前产业场景的PMF评估,为从业者指明方向。 一、从两个case说起 在苏州创业期间,租住的公寓配了一台云迹科技的送餐机器人。刚搬进去的时候我还挺期待——外卖不用下楼拿,听起来很方便。实际体验完全是另一回事。 按照产品设计的设想,流程应该是:骑手把外卖交给前台,前台管理员把外卖放进机器人并输入房间号 → 机器人自主乘梯 → 到达房门口拨打电话通知取餐 → 住户取走。听起来很合理。 但实际运转中,这台机器人暴露了一连串让人沮丧的问题: 它没手按门铃。公寓虽然有门铃,但机器人只能在房门口”等”,它也没法给住户打电话——它自身的语音声很小,关上门根本听不见。一旦我没听到门外的声音,它等一会儿就带着餐原路返回一楼了。有好几次我等了半小时,下去一看,机器人早就回去了。 它不知道”前面还有多少单”。前台按顺序把外卖放进去之后,我并不知道自己的外卖排队情况。配送体验非常糟糕,商家送到前台可能只要15分钟,但机器人从一楼…

AI 硬件的较量,正从"接入 AI"转向"产品成立"——从 Demo 能跑,走向产品能卖、用户能留。 过去两年,大模型快速进入智能眼镜、机器人、AI 陪伴、AI 教育等终端。到了 2026 年,”接入 AI”已经不再新鲜,行业真正开始较量的,不再是 Demo 能不能跑起来,而是一个更传统、也更难的问题:这款产品为什么存在,能不能稳定量产,用户会不会长期使用。能力越多,产品越需要克制——多模态交互的真正难点,也从”能不能加上”,变成了”怎么取舍、怎么让用户觉得对”。 8月9日下午,声网联合人人都是产品经理,在北京渔阳饭店举办「AI 硬件多模态交互的产品化破局」专场沙龙,近百位产品人、开发者与创业者到场,共同拆解 AI 硬件从 Demo 走向真实产品的那道坎。 浙江湃启科技CEO孙思宁、声网AI产品线负责人姚光华、灵宇宙产品负责人刘翠涛、阿里云百炼应用高级产品经理司红江,以及移远通信北区技术总监武风停,从产品、交互、端侧与供应链等不同位置,围绕 AI 硬件从 Demo 走向真实产品展开讨论。以下为几位嘉宾分享的核心内容。 一、具身在神不在形:先定义产品,再谈模型 孙思宁老师作为语音AI领域…

The Jetson Orin Nano 2 comes as the AI chip giant targets physical AI expansion.

2026具身智能黑马玩家昆仑行机器人,全面领先全球权威榜单 WorldArena。 据媒体报道,具身智能领域的权威评测WorldArena 2.0 Track 1发布了最新成绩,昆仑行机器人研发的昆仑世界模型GeWu,以69.58分的成绩,斩获图像质量(Image Quality)单项冠军,同时以65.91的综合得分,获得全球榜单亚军。模型在物理一致性(Physics Adherence)、可控性(Controllability)等多项关键能力维度上实现大幅领先,是本次77支参赛模型里,唯一一个在6大评测维度中,获得其中4项前4名次的模型,体现出极强的综合能力。 作为世界模型赛道的权威评测基准,WorldArena 由国际顶尖高校及科研机构联合共建,WorldArena 2.0在1.0的基础上构建全面基准,从模态、功能、平台三大关键维度扩展具身世界模型评估。本次评测的WorldArena Track 1赛道,聚焦具身智能模型的基础核心能力,重点考核模型“看得准、猜得对、画面真实合理”的核心素养,突出模型在物理因果上的合理性。 考核标准严苛,专业度拉满,WorldArena Track …

经专家评审及组委会复核,世界人工智能开源大赛(GOAI)初赛评审工作现已完成。依据赛事规则及各赛道评审结果,共有120个作品从全球2999个初赛作品中脱颖而出,成功晋级下一阶段。 现公布四大赛道晋级名单,具体名单详见以下海报: 赛道一「新智基座 Agent Infra」TOP30团队晋级复赛 赛道二「无界应用 Boundless Agents」TOP30团队晋级复赛 赛道三「前沿探索 AI for Research」中,赛题一、赛题二各取TOP20,合计40支团队晋级复赛 赛道四「具身未来 Embodied Future」中,赛题一、赛题二各取TOP10,合计20支团队直接晋级总决赛 恭喜所有晋级团队!期待大家在后续阶段继续以可运行、可验证、可复现的成果,展现AI开源的真实价值。 赛道一「新智基座」、赛道二「无界应用」、赛道三「前沿探索」的晋级团队将进入复赛阶段,请按赛事要求完成复赛作品材料准备与提交,提交时间为8月25日—9月3日;赛道四「具身未来」的晋级团队将进入总决赛线下调试阶段,并于8月25日—9月20日分组开展真机调试及决赛准备。具体安排请以GOAI大赛官方网站 https:…
