同一套权重zero-shot从仿真直落真机
作者|Li Yuan 编辑|郑玄 2026 年 9 月 1 日,梅卡曼德登陆港交所。一个过去很少被大众看见的机器人公司,终于被公开市场标出了价格,首日收盘总市值约 124 亿港元。 上市之前,一级市场和基石投资者已经先给出了自己的判断。梅卡曼德此次引入包括苏格兰百年资管巨头 Baillie Gifford 在内的 9 家基石投资者,合计认购 1.86 亿美元。 成立于 2016 年,梅卡曼德和宇树一样,都是上一轮机器人创业潮里走出来的公司。 但从第一天起,梅卡曼德就没有把重点放在造一台机器人上。公司名 Mech-Mind 里的「Mind」,指向的是另一件事:给机器人做感知、识别和运动规划。 2017 年,梅卡曼德推出第一代 Mech-Eye、Mech-Vision 和 Mech-Viz:相机负责获取 3D 点云和图像,视觉软件识别物体的位置与姿态,规划软件计算机械臂怎么抓、怎么走、怎么避障。到了今天,具身智能、物理 AI 和世界模型讨论的很多问题,仍然绕不开这些环节。 梅卡曼德卖出去的不是一台完整机器人,而是一套可以接到不同机械臂和产线里的智能组件。十年下来,这套东西被送进近 50 个…
李飞飞联合创办的World Labs发布了新一代世界模型Atlas。它能用少量图片重建3D空间,按照精确的相机轨迹生成视频,还把能力延伸到了机器人仿真。但对产品经理来说,真正需要判断的不是演示视频够不够惊艳,而是模型能不能持续维护环境状态、模拟行动结果,并转化为一个可控、可验证、可交付的产品。本文借Atlas讲清世界模型与大语言模型、多模态模型、视频模型的区别,并给出一套产品经理评估世界模型的五问框架。 现在每天都会习惯性地查一遍AI资讯。 一方面是工作需要,另一方面也是怕几天不看,AI圈又悄悄长出几个完全看不懂的新概念。 这两天看到了一条消息,李飞飞联合创办的World Labs发布了新一代世界模型Atlas。官方给出的定位很猛,全球首个多模态世界模型,能生成图像和视频、重建3D空间,还能用于机器人仿真。 世界模型这个词,我其实不是第一次听到了。 之前看具身智能、自动驾驶和机器人相关内容时,经常有人提到它。大语言模型已经能写文章、写代码了,多模态模型也能看懂图片和视频,视频模型生成的画面甚至越来越接近真实世界。 那为什么还需要一个世界模型? 它是一种新的模型架构,还是AI圈给视频生成…

李飞飞的 Atlas 来了 一张照片能够告诉 AI,房间里有一张桌子。但如果把镜头移到桌子背后,那里应该是什么样?如果机器人伸手推动桌上的杯子,接下来又会发生什么? 识别物体、生成画面和理解空间,是相互关联、却不能直接画等号的能力。李飞飞创办的World Labs,正在尝试跨越它们之间的距离。 昨晚,World Labs 发布新一代世界模型 Atlas,这是一款全域模型,团队从零开始预训练,使其能够原生处理文本、图像、视频和 3D 数据。Atlas 它将用于后续 Marble 及其他产品,目前面向部分合作伙伴开放早期访问,而非全面上线。 这款备受关注的多模态世界模型的亮点是什么? 按照官方披露,Atlas的主要能力包括世界生成、重建和模拟等广泛任务: 可控运镜:Atlas 可利用像素级相机控制,从一张或多张图像生成图像和视频,输出长达 1 分钟的 1440p 视频。 空间重建:Atlas 可以根据一张或数十张输入图像重建真实世界场景。它既可以生成来自新视角的图像帧,也可以生成明确的 3D 输出,其性能优于目前最先进的 3D 重建专用模型。 时空模拟:Atlas 通过输入视频对空间和时间…

李飞飞旗下 World Labs 发布全模态世界模型 Atlas,文本、图像、视频与 3D 数据统一锚定到三维空间位置;相机轨迹直接作为几何输入,可生成最长 1 分钟 1440p 视频,仅用 2-3 张照片即可重建真实场景,官方称超过专用 3D 模型。AI summary

李飞飞联合创办的 World Labs 发布多模态世界模型 Atlas:单张图片即可生成可任意视角观看的高细节 3D 环境,具备像素级相机控制,支持空间与时间的生成模拟,被视为其「空间智能」理论的落地。AI summary
Visko Platform Inc., an artificial intelligence research lab focused on developing persistent world models, said today it has raised $10 million in a pre-seed funding round from Llama Ventures. It’s also opening public access to its first foundation model, Orbis, which is based on a new paradigm the company calls “live models.” The startup says […] The post After raising $10M in funding, Visko debuts Orbis, its first live model for generating long-form videos appeared first on SiliconANGLE.
AI company Runway has unveiled Solaris, the first model in a new category it calls "Interface World Models." Instead of running code, the system generates the user interface frame by frame as you interact with it. The article Runway's Solaris is an AI system that generates software interfaces in real time appeared first on The Decoder.

近日,VAST宣布完成B轮和B+轮融资,合计约30亿人民币,由经纬创投领投,完美世界、蓝色光标、芯动能投资、延趣游戏、中科创达、广电投资、三七互娱等一线产业资本,鼎晖VGC、中金资本、CMC资本、洪泰基金、三正健康投资、中平资本、福建产投基金、福创投、卓源亚洲、江西金控等一线财投联合参投,老股东达晨财智、春华资本、四三九九、慕华科创、绿洲资本、渶策资本、华控基金持续超额追投。 不到半年,VAST累计融资约50亿人民币,刷新AI 3D领域融资额纪录。 至此,VAST战略投资方已覆盖对3D原生基座模型和世界模型有切实需求的各行各业。多元产业方资本的加注,意味着VAST技术能力已跨过“生产可用”门槛,正在成为多个行业3D内容生产的默认基础设施。 本轮融资将持续投入于3D原生模型与数据能力的迭代、训练与推理基础设施的扩建、产品开发与商业化落地的加速,推进AI 3D从“可用”走向“好用”,成为各行各业的AI 3D基础设施。 Tripo P2.0:全球首个原生四边面拓扑3D大模型,开启3D领域的Vibe Coding时代 与融资同步,VAST发布旗舰3D原生基座模型Tripo P系列最新版本——T…

视觉轨迹充当“同声传译”,让世界模型和机器人动作真正“同频对话”。 作者丨幸丽娟 编辑丨岑 峰 日前,一篇叫做《TrAct: Bridging Robot Control and Visual Prediction with Visual Tracks》的论文悄然上线 arXiv。论文署名中出现了两个大家很熟悉的名字——李飞飞、吴佳俊。 论文链接:https://arxiv.org/html/2608.24101v1 熟悉具身智能圈的人都知道,这两个名字放在一起,分量不轻。 李飞飞是世界模型“空间智能”方向的旗帜人物,而刚刚领完 IJCAI 2026 计算机与思想奖的吴佳俊,则是这一领域最核心的研究者之一。 这两位长期合作的学术战友,最近在具身智能领域动作频频。就在一个月前,他们刚与 ControlNet 作者张吕敏等十余位学者共同发表了《Masked Visual Actions for Unified World Modeling》,把机器人动作渲染成像素轨迹,喂给视频世界模型。 但对于他们而言,之前的尝试或许还不够彻底。 世界模型能看懂机器人动作了,但机器人动作那一侧的问题还卡着…

会生成未来,不等于理解世界。 作者丨吴思梦 编辑丨岑 峰 2026世界机器人大会的最后一天,一场题为“世界模型到服务人类的现实距离”的论坛对话,将八位分别来自模型、数据、本体、仿真各赛道的创业者拉到了同一张桌子上。 这场对话由刚刚获聘中国电子学会世界模型专委会主任委员的之江实验室主任、阿里云创始人王坚主持。八位对话嘉宾——大晓机器人董事长、商汤科技联合创始人王晓刚,奥比中光创始人、董事长黄源浩,无界动力创始人、CEO张玉峰,跨维智能创始人、CEO贾奎,智澄AI创始人、CEO胡鲁辉,飞渡科技联合创始人、总经理宋彬,蚂蚁灵波科技首席科学家沈宇军,极佳视界联合创始人、首席科学家朱政,均为该专委会委员。 尽管大家都在一个大领域里,但每个人对时代和技术的经历各不相同。王坚请八位嘉宾依次从自身经历出发,畅谈:你们认识的世界模型,到底是什么? 一个小时的讨论围绕三个议题层层递进,从“世界模型到底是什么”开始,到“高质量数据会不会成为不可逾越的成本障碍”结束。有人把它称作生成式AI“皇冠上的明珠”,有人自嘲是“卖铲子的人”,有人把底座能力比作“九年义务教育”,还有人追问属于具身智能的“DeepSeek…

FedEx 与 Dexterity 扩大合作,在马里兰州 Hagerstown 枢纽规模化部署 Foresight 世界模型与双臂 Mech 拖车装载机器人,从试点转入更大规模运营;双方将评估物理 AI 与目的站规划、挂车分配、维护及人力流程的整合。AI summary

红杉合伙人Sonya Huang提出“产品即智能”,Roblox用游戏卡带破解世界模型困境——两条线索指向同一件事:真正有壁垒的是应用与模型之间别人学不走的数据飞轮。国内少有公司同时做这两件事,Loopit发布自研世界模型Zing-0.5。 我之前写过红杉美国合伙人Sonya Huang的那篇演讲,也写过Roblox用“游戏卡带”破解AI世界模型困境的那篇研究。这两篇文章之间有一条我没有显式点出来的逻辑线——如果你把它们放在一起看,会发现它们其实在回答同一个问题:在AI时代,一个真正有竞争壁垒的产品,到底长什么样子? 红杉的答案是:Not your weights, not your product。你调用的API,是你的产品最核心的那部分,但你对它没有任何控制权。Roblox的答案是:画面连续不等于世界存在,AI负责渲染,代码负责逻辑,两者必须共同在场才能撑起一个真正可交互的世界。这两个判断看起来方向不同,但其实指向同一件事:光有应用不行,光有模型也不行,真正有价值的东西,是两者之间那个别人学不走的数据飞轮。 这条逻辑在美国开始有越来越多的公司在实践,但在国内,我很少看到同时做这两件…

机器人世界模型的下一场竞争,可能不是画质,是架构。 作者|Li Yuan 编辑|郑玄 一只机械臂的夹爪明明没有夹住杯子,杯子却像被磁铁吸住一样,跟着夹爪升了起来。这个看似荒诞的问题,正在困扰机器人世界模型,业内甚至将其称为「磁铁式抓取」。 视频生成模型只要让画面看起来合理,就算完成任务;但世界模型不能只追求「像真的」。机器人训练数据大多来自成功演示,模型容易形成捷径:与其理解动作的细微差别,不如按照画面,直接生成最可能的结果。 可在真实世界里,夹爪位置偏移几毫米,就可能让结果从抓起变成碰倒杯子甚至抓空。世界模型真正需要理解的,是动作与结果之间的因果关系。 8 月 27 日,自变量机器人发布下一尺度自回归世界模型 WALL-SS,试图让世界模型从「能用」走向「好用」。WALL-SS 不是一次性生成整个画面,而是通过由粗到细的方式描绘未来,让不同动作真正对应不同结果;同时结合长时记忆机制,实现最长 60 秒连续推演。 测试显示,WALL-SS 连续推演 60 秒后,画面和运动轨迹仍更接近真实视频,动作跟随得分达到 0.29,而 Cosmos3-Nano 为 0.044,其他测试模型干脆为 …
arXiv:2608.22294v2 Announce Type: replace Abstract: World models for physical interaction are typically trained to predict future observations or latent features; however, a planning-oriented model must answer a fundamentally different question: whether a candidate action produces a task consistent future while preserving essential relations. Monolithic state representations obscure the underlying entities, while standard instance-level object slots merely identify what is present without specif…
arXiv:2608.27073v1 Announce Type: cross Abstract: Explorable image-to-scene generation is essential for applications in gaming, robotics, and virtual reality. Existing methods based on video diffusion model (VDM) commonly rely on incomplete conditioning signals such as sparse point clouds or 2D panoramas, leading to stochastic hallucinations, long-term drifts and suboptimal 3D consistency. We present SpatialCrafter, a novel two-stage framework that addresses these issues by introducing a global …
arXiv:2608.27406v1 Announce Type: new Abstract: State-of-the-art action-conditioned video models are typically restricted to a single robot embodiment, preventing them from leveraging the vast corpus of heterogeneous video data that contains rich signals for learning generalizable physics. To bridge this gap, we introduce CLAP, a framework for cross-embodiment action-conditioned video generation capable of being trained on diverse, internet-scale videos across human and robotic agents. CLAP is g…
arXiv:2608.26239v1 Announce Type: new Abstract: Generative world models provide robots with predictive models of how the world evolves under interaction, with growing potential for simulation, planning, policy evaluation, and robot learning. Beyond clip-level future prediction, a unified generative formulation should relate actions to consequences, support flexible horizons and continuous interaction, and enable reward-driven optimization. We introduce WALL-SS, a world model that generates visua…
2026具身智能黑马玩家昆仑行机器人,全面领先全球权威榜单 WorldArena。 据媒体报道,具身智能领域的权威评测WorldArena 2.0 Track 1发布了最新成绩,昆仑行机器人研发的昆仑世界模型GeWu,以69.58分的成绩,斩获图像质量(Image Quality)单项冠军,同时以65.91的综合得分,获得全球榜单亚军。模型在物理一致性(Physics Adherence)、可控性(Controllability)等多项关键能力维度上实现大幅领先,是本次77支参赛模型里,唯一一个在6大评测维度中,获得其中4项前4名次的模型,体现出极强的综合能力。 作为世界模型赛道的权威评测基准,WorldArena 由国际顶尖高校及科研机构联合共建,WorldArena 2.0在1.0的基础上构建全面基准,从模态、功能、平台三大关键维度扩展具身世界模型评估。本次评测的WorldArena Track 1赛道,聚焦具身智能模型的基础核心能力,重点考核模型“看得准、猜得对、画面真实合理”的核心素养,突出模型在物理因果上的合理性。 考核标准严苛,专业度拉满,WorldArena Track …

今天,距离 ECCV 2026 在瑞典马尔默开幕只剩 12 天,会前预热迎来最重磅的一天:官方完整议程首次揭晓,图灵奖得主 Yann LeCun 携手自动驾驶与世界模型领域的两位顶尖学者压轴 Keynote;与此同时,中国团队带来仅 71M 参数的实时人像“全能模型”,CMU 则拿出能一键修复 3D 渲染瑕疵的通用视频模型。 这些进展不仅勾勒出本届大会“世界模型 + 自动驾驶 + 轻量实时生成”的主线,也为关注 AI 视觉落地的从业者、研究者与投资人提供了清晰的观察坐标与持续跟踪清单。 会议情况 欧洲计算机视觉会议(ECCV)与 CVPR、ICCV 并称计算机视觉三大顶会,偶数年举办。本届将于 9 月上旬在瑞典马尔默举行,整体会期与关键信息如下: 名称 ECCV 2026(第 19 届欧洲计算机视觉会议) 时间 2026 年 9 月 8–12 日(Workshops/Tutorials 9/8–9;主会与 Expo 9/10–12) 地点 瑞典马尔默,Malmö Arena 与 Malmömässan 会展中心 官网 https://eccv.ecva.net/ 时区 马尔默 CEST…
如果说,基础模型是具身大脑的“大学”通识课;那么,垂域模型则是机器人在工业领域的“专业课”。 作者丨董子博 编辑丨林觉民 今天要做世界模型,所有人都知道要做预训练,来让具身大脑变得更聪明;也知道要做后训练,让机器人可以在专门的任务下得到锻炼、做得更好。 和不少公司聊过,AI 科技评论发现,谈到中训练(Mid-train)的公司却很少。 而实际上,在具身的实际落地中,却存在一些原有方案不易解决的问题:当预训练的 VLA 模型,没法在具体的场景中发挥全部智能;而后训练却有时间、成本的门槛;在训练技能的环节,也容易出现数采、训练和调试的重复工作——VLA 落地要真正提效,中训练或许才是破局的良方。 AI科技评论独家获悉,乐聚机器人将推出面向工业场景构建的“垂域具身智能模型”——KUAVO VLA。据了解,该模型以通用VLA 基础模型为能力起点,使用 600+ 小时KUAVO 同构型真机数据进行了中训练,将本体适配、基础操作和工业场景的共性能力沉淀到模型中。 乐聚机器人 KUAVO VLA 赋能下,在不少场景中可以实现大约一倍的提效,在某些任务中甚至可以做到100% 的成功率。 模型中训练,会…
