Lin Junyang, the former Alibaba Qwen technical lead and one of the youngest P10-level engineers at the company, has founded Pragmatik Labs in Shanghai with a 2 billion dollar angel-round valuation. Gaorong and HSG co-led with 100 million dollars each, Tencent added 20 million, and the company is positioning itself around digital and physical agents rather than another foundation model.

长期以来主要依赖云端大模型的Agent,正在出现另一条技术路线:不再单纯追求更大的模型,而是通过改变语言模型的生成方式,再叠加端侧芯片的并行算力,压缩Agent执行任务所需的时间。
过去两年,大模型的能力边界不断向外扩展。文本、图片、视频、语音模型快速迭代,Agent也开始进入企业生产流程。对于企业来说,可选的AI能力越来越丰富,但实际使用时需要处理的问题也随之增加:一项任务应该调用哪个模型,如何平衡生成效果和成本,不同部门如何管理AI预算,生成后的内容资产又该如何沉淀。 尤其在视频商业场景中,一条内容从创意到最终产生效果,通常会经历脚本、图片、视频生成、数字人、配音、剪辑、分发等多个环节,背后可能连接不同模型、算力和工具。过去分散使用几款AI产品还算容易,当应用规模扩大到多个团队、品牌、门店和市场之后,模型调用、账户体系和预算管理开始成为企业AI落地中的实际问题。 近日,筷子科技Kuaizi.ai正式发布视频商业AI能力统一价值单位“KP”及企业“KP钱包”。按照其公布的方案,一个Kuaizi企业账户对应一个KP钱包,可以使用丽帧引擎、Kuaizi主平台、Kuaizi国际版、“推你”及企业级FDE服务,覆盖模型调用、内容生产、分发传播、资产管理以及企业级部署等环节。 多模型时代,企业需要更简单的调用方式 模型生态的丰富已经带来明显变化。OpenAI、Anthro…

Expedia Group开源了mockql-rs",这是一个Rust CLI工具,可以在请求时从LLM生成GraphQL的模拟响应。这是过去六个月内第三次公开尝试解决这一问题,前两次分别是Airbnb在4月推出的@generateMock指令和2月份开放的GraphQL基金会RFC"。这三种方案采用了显著不同的设计,其中两种使用相同的指令名称但含义并不相同。 它们的共同前提是GraphQL选择集(GraphQL selection set)已经是一个规范。Expedia Group的软件工程师Samuel Vazquez指出了这种方法的吸引力,它颠覆了生成工具的常见失败模式,即模型不擅长创造形状,但擅长填充形状,而schema为它们免费提供了一个界限明确的形状。换句话说,就是开发者不再需要手工输入一个两百行的JSON固件文件,如果第二天早上schema发生了变更,该文件就会失效。 mockql-rs作为独立进程位于客户端和服务器之间。开发者使用@mock注解标注字段以及可选的提示,该工具使用apollo-compiler解析并验证针对schema的操作,将被注解标注的字段与真实字段分…

学术数据和真实数据完全是两回事;可解释性成落地“生死线”。 作者丨幸丽娟 编辑丨岑 峰 三年前,正值大模型爆发之年,麦肯锡就曾对全球交通与工业领域的从业者做了一项调研,问题很朴素:距离真正的智能化,还有多远? 答案出乎意料地悲观:还要10到20年。 而把时间线拉到现在,模型越来越大、智能体越来越多、时空数据挖掘的论文层出不穷。 现实依旧是,全球没有一座城市长期部署了基于强化学习的交通信号控制系统。那些在顶会上“超越所有SOTA”的预测模型,真正到了城市交通部门手里,他们的答案往往是:“这个方案,我不敢放手用。” 问题的症结在哪里? 在刚刚结束的 IJCAI 2026 Early Career Spotlight(早期职业焦点)演讲中,慕尼黑工业大学 (TUM) W2 教授黎子玥(Ziyue Li)给出了他的答案: 第一,学术研究长期停留在“干净数据”的舒适区,而公共部门面对的,永远是不完整、不规整、不可控的真实数据; 第二,可解释性不是论文里的加分项,而是从实验室走向城市落地的“生死线”。 黎子玥的履历横跨学界与工业界:香港科技大学工业工程与决策分析系博士,现任慕尼黑工业大学W2教授,…

过去几年,AI芯片行业最容易比较的是一张卡。雷峰网 雷峰网 峰值算力多少、显存多大、带宽多高,几组参数放在一起,似乎就能迅速分出高下。但当大模型进入规模化训练与推理,尤其是MoE、Agent等新型负载不断拉高算力需求后,单卡性能正在变得越来越不够用。 真正进入数据中心,一张卡能跑多快只是第一关。数十张、数百张乃至上万张芯片如何高速互联,软件能否把硬件能力释放出来,集群能否在高负载下长期稳定运行,正在共同决定一套算力系统最终能够交付多少有效算力。 AI芯片的竞争,正在从“造一颗更快的芯片”,变成一场芯片、模组、互联、软件和集群共同参与的系统战。 这也让燧原科技过去八年的一条技术路线,开始显出不同的价值。 从2018年成立开始,燧原选择的就不是一条只围绕单颗芯片展开的道路。四代架构、5款云端AI芯片之外,它逐步向AI加速卡及模组、编程软件平台、智算系统和大规模算力集群延伸,最终搭起了一套覆盖芯片、硬件、软件与集群的核心技术体系。 这套体系也已经越过实验室阶段。燧原多代产品进入大型互联网公司的真实业务,在国民级应用中实现规模化部署;与此同时,千卡、万卡级智算项目也已经走向商业化。 因此,如果…

国家人工智能基金14亿元入股可灵AI;智谱上半年收入同比增近400%;欧菲光澄清“掏空资产”传闻;中际旭创拟回购40亿至80亿元股份;*ST闻泰:法院裁定冻结安世及安泰可相关股权财产;中国巨石据悉已正式上调9月份电子布价格;工信部:探索通过首购首用、风险补偿等模式,加大大模型、智能体、Token等服务采购力度。

Skild AI says its S1 robot foundation model enables robots to learn new tasks just by seeing a video of it being performed. The post Skild AI unveils S1 flagship robot foundation model appeared first on The Robot Report.

藏在世界人形机器人运动会上的三个底层具身难题。 作者丨齐铖湧 编辑丨董子博 8 月的最后一周,国家速滑馆“冰丝带”,第二届世界人形机器人运动会。 朋友圈里刷屏最多的,是田径赛场上机器人百米冲刺、跳远,无论是跑出新纪录,还是电机着火,这些画面都会吸引大量的普通观众。 但AI科技评论问了几位深度参与到这次运动会的具身从业者,专业观众们最关注的比赛是什么,都得到了统一的答案:场景赛。 场景赛现场没有跑道,只有临时搭建的客厅、厨房和货架,进行的是家庭、餐饮、商超三项场景比赛。 业内有一个心照不宣的共识:场景赛≠竞技表演,是机器人真实工作能力大考。田径项目考的是运动控制算法,只要算力足够,一套动作在仿真环境里跑上几万遍,总能算出最优解; 但场景赛考的是具身大模型,包含“大脑”和“小脑”,环境是动态的,物品是柔软的,随时会有人来打断你的工作,对模型泛化能力的要求,完全不在一个量级。 这届比赛,还有一个不太被外行注意,但在圈内引发热议的规则:允许遥操。 尽管遥操遭到行业内外各种鄙视,但在这种顶级大会上依旧允许遥操,那是因为想要做到全自主,门槛实在太高了。但AI科技评论仔细阅读了一下这次的积分规则,有…

前两年,我在河南、河北、东莞、深圳等地,认识过一批「AI 玩具公司」。 它们做的事情大体相似:定制一个手办,再给它加上语音对话;或者把语音模组塞进毛绒玩具,让一个普通玩偶可以和人聊天。一些公司甚至借着 AI 的新鲜感迅速出海。 2024 年前后,这件事情本身还有一定的技术门槛。要让一个玩具真正开口,需要把主控、麦克风、联网等硬件,与 ASR、LLM、TTS 等软件服务串起来。对于传统玩具厂商和 IP 方来说,这已经超出了原本熟悉的能力范围。 但这两年,AI 硬件的开发门槛下降得越来越快。 3D 打印、PCB 打样和成熟开发板越来越容易获得,开源社区也已经提供了大量现成方案,从语音对话到舵机、电机控制,都可以找到较为成熟的项目。 最近,我们拿到了这样一块近乎「傻瓜式」的 AI 模组。不用写代码,在开发平台选好模型、音色和角色,几分钟就能让它开口说话。再塞进一个毛绒玩具,一款最基础的 AI 玩具就有了。 做出这块模组的是一家 2025 年成立的澜存科技。 澜存目前有两个核心产品:澜卡 LC-1.7 系列标准 AI 模组,以及配套的澜存智能平台。前者集成语音、联网和多种硬件接口,可以继续外接…

Token 成本成为大模型硬件竞争的新坐标。 作者丨郑佳美 编辑丨岑 峰 今天,OpenAI 的自研推理芯片 Jalapeño,终于从规格表走到了跑分台。 这次公开的数据很接地气:Token 吞吐、生成延迟、单位功耗下能跑多少推理。因为大模型上线以后,芯片面对的早就不只是一次训练任务。ChatGPT 要一直回消息,Reasoning 模型要持续生成长链路内容,Agent 还会一轮接一轮调用模型。算力再高,Token 吐得慢、延迟压不下来、功耗又高,数据中心照样难受。 成绩一出来,Reddit 很快就把 Jalapeño 和 NVIDIA Rubin 摆到了一起。有人认为它已经进入 Rubin 的效率区间,也有人认为测试条件、软件优化和整个平台形态没有对齐,现在还没法直接分高下。争论暂时停在这里,没有统一答案。 更巧的是,Jalapeño 并不是孤例。NVIDIA 正在把 Groq 3 LPU 拉进推理系统,专门处理 Token 生成;Google 也把 TPU 8 拆成偏训练和偏推理的两条路线。几家公司几乎在同一时间开始重新拆芯片的工作,背后那套硬件逻辑难道真的已经变了吗? 01 Ja…

当 VLA 模型理解语言、感知环境并直接生成机器人动作,一个更基础的问题开始浮现:机器人如何理解一个持续变化的物理世界?物体从哪里移动而来、杯子此前遮住了什么、机械臂正在接近还是远离目标——真正决定下一步动作的信息,往往不只存在于当前一帧,而存在于连续的时间之中。 近日,大晓机器人联合香港大学发布全新的连续物理智能研究成果 StreamPI(Streaming Multimodal Temporal Modeling for Vision-Language-Action Models),直指 VLA 长期存在的“单帧智能”瓶颈,为其补上关键的“时间维度”。不同于传统 VLA 主要依据当前观测独立决策,StreamPI 为模型建立持续的多模态时序上下文,使机器人能够记住过去、理解状态变化、判断任务进程,并利用跨帧信息增强精细空间感知与动作决策。它推动 VLA 从“识别当前状态”,进一步走向“理解一个正在发生的物理过程”。 更重要的是,StreamPI 并未依赖额外参数堆叠换取时序能力,而是基于现有 VLA 骨干,通过指令持续锚定、历史信息流式缓存与随机时间间隔训练,实现从单帧决策到连续时…

谁不想在新年到来之际收到一只可爱的 AI 机器鸭呢? 距离 2026 年圣诞节还有四个月,在英伟达以约 129 亿美元收购消息曝光次日,AI 开源社区 Hugging Face 发布了一款名为 Microduck 的小机器人。它身高 25 厘米、重不足 800 克。演示视频里,它用喙叼着袜子摇摇晃晃地走路,被人推搡时会尽力稳住,即便倒下也能自己爬起来,甚至可以穿上轮滑鞋滑旱冰。 产品售价 399 美元(约合 2,700 元人民币),有奶油白、石墨灰、薰衣草紫、天空蓝四种配色可选,附赠一只游戏手柄。联合创始人克莱姆·德朗(Clem Delangue)在社交平台 X 上放出一段 50 秒的演示视频,几个小时内浏览量接近 40 万。 (来源:Pollen Robotics) 从语音互动,到“走”进真实世界 做开源大模型托管平台起家的 Hugging Face,入局具身智能的节点要追溯到 2024 年初,前特斯拉(Tesla)Optimus 团队科学家雷米·卡德内(Rémi Cadene)加入,主导开源机器人库 LeRobot 的开发;2025 年 4 月,Hugging Face 完成对法国…

arXiv:2608.25757v2 Announce Type: replace Abstract: Generalist vision--language--action (VLA) policies learn long-horizon behavior mainly through short-horizon action prediction and reveal little beyond sampled commands. This creates two coupled bottlenecks: a single action target must implicitly absorb task progress, intermediate intent, and local reliability, while these control states remain hidden during execution. Inspired by functional principles of biological sensorimotor control, we intr…
arXiv:2510.25548v3 Announce Type: replace Abstract: In task and motion planning, high-level task planning is done over an abstraction of the world to enable efficient search in long-horizon robotics problems. However, the feasibility of these task-level plans relies on the downward refinability of the abstraction into continuous motion. When a domain's refinability is poor, task-level plans that appear valid may ultimately fail during motion planning, requiring replanning and resulting in slower…
arXiv:2608.26182v1 Announce Type: cross Abstract: Large language models (LLMs) are increasingly used for verbal interaction in social robots, yet prompt design in human-robot interaction (HRI) remains underspecified. As a result, robots may present hallucinated capabilities, unclear behavioural boundaries, and misleading personas. This paper develops a framework for prompt design in LLM-based robots and introduces a structured prompt template comprising eight functional components through which …
arXiv:2608.27384v1 Announce Type: new Abstract: Vision-Language-Action (VLA) models are increasingly promising for robotic manipulation, yet their real-world deployment remains bottlenecked by high inference latency and unstable asynchronous execution. This challenge is particularly pronounced in flow-matching-based VLA models, where action decoding requires multiple iterative steps conditioned on the VLM context. While efficient inference methods improve control frequency and asynchronous metho…
arXiv:2608.27079v1 Announce Type: new Abstract: Pretrained vision-language-action (VLA) policies provide strong priors for robot manipulation, yet adapting them online to fine-grained biomedical tasks remains challenging. Task success often hinges on subtle, view-dependent visual cues, while task-level rewards provide little guidance about which regions matter, making it difficult to learn task-relevant visual grounding from limited real-robot interaction. Online adaptation is further constraine…
arXiv:2608.26821v1 Announce Type: new Abstract: Vision-language-action (VLA) models leverage pretrained vision-language representations for robot control, yet simply adding historical frames does not reliably capture recent physical change. This is especially problematic in multi-stage manipulation, where visually similar states may require different actions depending on prior execution. To address this challenge, we present TemporalFlow-VLA, which learns compact execution history through physic…
arXiv:2608.26673v1 Announce Type: new Abstract: Large pretrained vision-language-action models dominate modern robot-manipulation benchmarks, but it remains unclear how much model scale is necessary for strong language-conditioned control, or whether fundamentally different control architectures can remain competitive at much smaller parameter budgets. We present PredVLA, a language-conditioned predictive-coding policy with only 0.68 million trainable network parameters and no robot-data pretrai…
arXiv:2608.26645v1 Announce Type: new Abstract: Vision-Language-Action Models~(VLAs) have demonstrated significant promise in generalizing to complex, long-horizon robotic manipulation tasks. However, their performance remains brittle, as they are typically trained on trajectory-monotonic, failure-free demonstrations. This reliance on ``perfect" data leaves them unable to recover from common execution errors, such as a missed grasp, a dropped object, or an unexpected collision. In this paper, we…
arXiv:2608.26578v1 Announce Type: new Abstract: This work introduces Configured Failure Trapping, a novel backdoor attack task against Vision-Language-Action (VLA) models, which aims to activate attacks through stealthy textual triggers and induce configured failure modes. Unlike prior backdoor attacks that treat any task failure as a successful attack, Configured Failure Trapping requires the attacker to control how the robot fails (e.g., causing the robot to grasp with a specified positional o…
arXiv:2608.26496v1 Announce Type: new Abstract: Navigation in unknown environments to find unforeseen objects has become increasingly feasible with capable vision and language foundation models. However, these models also introduce non-negligible inference latency, which becomes an important concern when agents must operate continuously in the real world. Most state-of-the-art methods are still developed in synchronous simulators, where the environment waits for the agent to act and inference ti…
站在 2026 年 8 月北京世界机器人大会(WRC)的展馆中心,如果你闭上眼,听到的不再是两年前那种对“机器人像人一样跳舞”的惊呼,取而代之的,是从业者们在心里拨动算盘,计算 ROI(投资回报率)的声音。 具身智能正在经历一场从“秀肌肉”到“翻账本”的集体变轨。 回看这半年的轨迹,这种趋势演进得极具层次感: 5 月的维也纳 ICRA,学术界和产业界第一次如此默契地把所有火力都集中在了 VLA(视觉-语言-动作)模型上,那是具身智能的“物理学补课期”; 7 月初的上海 WAIC,200 多家具身智能企业同台竞技,集体把演示从“后空翻”换成了“拧螺丝、叠衣服”,那是行业的“场景落地焦虑期”。 7 月底的悉尼 RSS,开源硬件、仿真工具链和遥操作数据方案成为主角,行业开始为“大脑聪明、身体廉价、数据贫瘠”搭建公共底座,那是产业的“基础设施奠基期”。 而在 8 月的北京 WRC,所有话题似乎都围绕工程约束和商业底线展开。在这里,没人关心你的模型是否有哲学意义上的“意识”,大家只盯着三个指标:多少钱?多稳?跑一个月能省几个人的工资? “以前我们聊的是什么时候 AGI,现在我们在聊这台机器人跑一…

强化学习之父Rich Sutton接受红杉访谈,把矛头对准当下最主流的大模型路线:互联网数据终有上限、模型上线后权重基本冻结,行业或已陷入“局部最优”。他创办Oak Lab,押注能从自身经验持续学习的Agent,重新定义AI演进路径。 说起强化学习之父 Rich Sutton,AI圈几乎没人陌生。 他写下的《苦涩的教训》,至今仍被很多人视为理解AI发展的重要框架:从长期看,能够随着计算规模扩展的通用方法,往往会战胜依赖大量人工知识设计的方案。 但最近接受红杉资本访谈时,Sutton却把矛头对准了今天最主流的大模型路线。在他看来,LLM当然是一次伟大的科学突破,却也可能成为《苦涩的教训》的反面案例。 原因很简单。今天的大模型虽然摆脱了大量人工规则,却重新被“人类已经知道的东西”限制住了。互联网数据终究有限,合成数据背后依然需要人来决定什么值得生成。 而更关键的是,模型仍然不具备人类那样的持续学习能力。 一个司机开了10年车,会从经验里形成大量直觉。但今天的大模型,大部分学习都集中在预训练和后训练阶段。模型上线后,即使每天和几百万人交互,核心权重依然基本被冻结。 在Sutton看来,今天的…

从录音卡到儿童手表,再到摄像机,小度AI硬件掌舵人孙浩复盘了多款产品的成败得失。他提出,大模型能力涌现后,真正的挑战在于场景、成本、上下文与安全之间的平衡。本文从实战出发,拆解AI硬件从技术到产品成立的完整路径。 在 2026 AI 产品大会上,小度AI智能硬件掌舵人孙浩分享在 360 和小度做过的几条产品线,从复盘录音卡、儿童手表、摄像机和家庭 AI 伙伴的路径。他想回答的是能力涌现之后,怎样在场景、成本、上下文和安全之间把产品真正做成立。 以下内容根据现场音频和演示材料整理,Enjoy: 一、我做过很多硬件,但真正的问题一直没变 大家好,我是孙浩。 我一毕业就进了 360,在那里干了 12 年,最早做儿童手表,后来做智能音箱、边缘计算、视觉云,再后来整体负责 360 IoT 的产品研发、供应链和生产相关工作。年初我离开 360,到了小度。对我来说,这次分享不是站在旁观者角度讲一个趋势,而是把自己做过、踩过、犹豫过的产品拿出来复盘。 我给自己的定位一直是“极客型产品经理”。 这个词不是说我要做只有极客才会用的东西,而是说我希望自己有前沿技术的判断,把原来只在小圈子里流行、很晦涩的技术…
