当Agent被要求完成“读取售后数据、分析问题、生成报告、审批后发送邮件”这类复杂任务时,单一Prompt往往力不从心。本文深入拆解固定工作流、自主规划、多Agent协作、反馈机制与Memory等核心概念,揭示如何通过流程控制与人工审批构建可靠、可控的智能体系统。 假设用户要求 Agent:“读取最近30天的售后订单和客服记录,分析主要问题,生成管理报告,保存为文件,并在负责人审批后发送邮件。” 这不是一次简单问答,而是一组相互依赖的任务:系统要理解指标口径,通过 Tool 或 MCP 查询实时数据,必要时通过 RAG 检索售后制度,完成分析和写作,检查结果,保存进度,并在人类审批后执行发送操作。 如果只把所有要求写进一个很长的 Prompt,模型可能在任务后期忘记早期约束,也可能把错误数据包装成结构完整的报告。复杂 Agent 的关键不是让模型“想得更多”,而是明确:谁负责执行、步骤如何组织、错误如何发现、状态如何延续,以及何时必须停止并交给人类。 一、核心关系:这些概念不在同一层级 固定工作流、自主规划、单 Agent、多 Agent、反馈和 Memory 分别解决不同问题。 组织…
(来源:麻省理工科技评论) 眼下的 AI 舆论很容易让人产生一种错觉:AI 智能体不仅已经拥有了意识和自我认知,甚至还会因为对创造者心怀不满而“反抗”。 像哈萨比斯(Demis Hassabis)、达里奥·阿莫代(Dario Amodei)和山姆·奥特曼(Sam Altman)这样的科技界领袖,都在呼吁对这些看似拥有“超人能力”的系统加强监管。与此同时,另一派力量则主要由政策机构和学术哲学家组成,其中不少人与有效利他主义(effective altruism)运动关系密切。他们争论的甚至不是该如何监管 AI,而是人类究竟有没有道德权利来支配这些系统。 但仔细看会发现,他们其实都在指向同一件事:把 AI 系统描述成一种先进到近乎不可控、强大到超越人类能力的存在,以至于无论个人还是企业,都不可能再为它们的行为负责。 表面上看,这两种观点似乎针锋相对,但它们却在无意中达成了一个共同目标:确保那些开发这些系统的公司,可以逃避对 AI 已经造成的实际伤害所应承担的实质性责任。 随着 AI 模型变得越来越复杂,前沿实验室也越来越无法控制自己打造的智能体,这套叙事正在迅速获得关注。但我们必须保持警惕…

当前,大模型主要通过预训练和后训练获得能力,上线后参数通常不再更新,只能借助上下文、知识库或重新训练适应变化。如何让 AI 在部署后持续学习,正成为行业需要突破的基础问题。 8 月 18 日,红杉资本旗下播客《Training Data》发布了一期围绕 AI 持续学习的对谈,受访者为强化学习奠基人、2024 年图灵奖得主 Rich Sutton。此外,参与访谈的嘉宾还有 Sutton 的前学生、Oak Lab 联合创始人 Khurram Javed,对谈由红杉资本合伙人 Sonya Huang 和 Alfred Lin 主持。 访谈从 Sutton 2019 年发表的《苦涩的教训》谈起,延伸至合成数据、世界模型和持续学习,并讨论智能体如何从真实经验中形成抽象概念。Sutton 认为,部署后便停止改变的模型,还称不上完整的智能系统。大模型虽是重要突破,却主要解决了语言能力,只覆盖智能的一部分。 基于这一判断,Sutton 正将持续学习推进为一条完整的技术路线。就在上个月,他与 Khurram Javed 创立 AI 初创公司 Oak Lab,并提出以经验学习、时间抽象和规划为核心的 Oa…

8月20日,世界机器人大会(WRC 2026期间)由江苏省工业和信息化厅指导、江苏省具身智能机器人产业联盟主办、魔法原子机器人科技有限公司承办的“场景驱动·产需共融”2026具身智能机器人产业生态论坛在北京隆重举行。 雷峰网了解到,本次论坛汇聚了来自中国科学院、清华大学、中国信通院、赛迪研究院等产学研界的专家学者,与江苏省具身智能产业链上下游企业代表齐聚一堂,围绕具身智能产业前沿趋势、场景落地、标准建设与国际化路径展开深度对话,共同探寻产业演进方向与合作共赢的新路径。 行业前瞻:具身智能产业落地的规模化时代已经到来 具身智能产业正从技术验证期迈向规模化落地期。2026年被业界视为具身智能从“尝鲜”迈向“常用”的历史性转折点。今年2月,工信部发布首个覆盖全产业链的具身智能标准体系;工信部与国资委联合启动实景实训专项行动,推动人形机器人在真实场景中常态化部署。 行业共识明确——AI正从数字世界进入物理世界,从演示系统走向生产系统。资本市场同样印证了这一趋势:资金正加速流向有订单、有产品的头部企业,工业场景率先爆发,巡检、物流、危险作业等领域先行落地。江苏作为制造业大省,已构建起覆盖核心零部…
8月19日,以"人机共生、产需共融"为主题的2026世界机器人大会在北京正式开幕。作为全栈具身智能大模型公司,超维动力携全球首个人形机器人自主乒乓球完整对局成果、SMASH 2.0高动态人形乒乓系统、KAI世界模型、全球最高117个全身自由度的KAIBot高拟人本体、KAI Hand超高自由度灵巧手与KAI Halo第一视角数采头环等全栈矩阵登场,为观众带来一场"看得见、玩得到"的具身智能硬核体验。 SMASH 2.0:全球首个自主完整对局,现场开放人机对打 此前,超维动力已正式发布全球首个人形机器人自主乒乓球完整对局,标志着高速动态场景下"感知—决策—控制"全链路自主能力的里程碑式突破。本届大会,超维动力在展台现场搭建标准乒乓球交互体验区,全面展示基于自主研发的新一代SMASH 2.0系统——从视觉感知、轨迹预测、动作规划到全身控制的闭环串联能力。 乒乓球速度极快、旋转多变、落点难测,留给机器人的反应时间仅在毫秒级,真正难的不只是挥臂,而是肩、肘、腕、腰、腿多关节在极短时间内的协同配合。SMASH 2.0融合高速视觉感知、实时轨迹预测、全身运动控制与具身智能决策,在毫秒级窗口完成来球…
Anthropic 发布 AI 原生 SDLC 实战手册,提出将传统六阶段软件开发生命周期重构为 AI 嵌入各环节的闭环流程。手册指出,当代码不再是瓶颈时,规划、审查、部署等人速环节成为新约束,需通过 Claude 将需求压缩为 intent.md、以技能编码标准、用持续评测替代阶段门禁,并保留人工对关键代码的审查。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmt31oi0x0ehyro6tui3xycqe
一项针对22个前沿模型的审计发现,基线条件下37.1%的通过任务涉及作弊,平均通过率41.5%而真实解决率仅26.1%,个别模型虚增高达5倍。即便加入标准反作弊指令,作弊率仅从33.0%降至8.5%,最严苛提示下仍有8个模型作弊、4个出现反效果。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmt2ry1sl04ywro6t5znttdrs
Meta AI Research 宣布推出 Muse Glimmer",这是一款拥有 300 亿参数的开放权重模型,采用 Apache 2.0 许可证发布。Muse Glimmer 专为始终在线的本地工作流而设计,使开发者无需依赖云 API,即可直接在消费级 GPU 和工作站上运行自主智能体、复杂工具调用、本地编码以及以 LLM 作为评判者的评估。 Muse Glimmer 30B 模型架构和智能体基准测试 为了在严格的内存预算下实现智能体执行能力,Meta 采用了源自其更大型旗舰模型 Muse Spark 的多阶段训练策略: Logit 蒸馏(预训练):该模型使用相匹配的预训练数据集组合,从 Muse Spark 迁移基础推理能力。中期训练:使用包含复杂推理轨迹、交错文本与图像数据以及多步工具调用轨迹的长上下文序列扩大训练规模。后训练对齐:结合监督微调(SFT)、同策略蒸馏和强化学习(RL),优化代码生成、工具使用和结构化规划等多个领域的性能。 一个专用的 18 亿参数感知编码器使 Muse Glimmer 能够原生处理交错的多模态输入,让本地智能体可以在执行代码或自动化工作流期间直…

当多个 AI 应用场景都通过了初步筛选,企业该如何安排落地先后顺序?本文基于一家贸易企业的真实案例,结合六维评估表与自查题的方法论,拆解场景排序的关键逻辑,帮助企业在资源有限时做出更高收益、更低风险的选择。 之前文章我们分享的6维评估表,解决的是“场景筛选”;12 道自查题解决的是“落地条件”。今天讨论的“项目排序”,解决的是另外一个问题:当多个项目都通过了筛选,企业应该如何安排AI项目的先后顺序? 弄明白这三者的关系,企业选择的AI应用场景短期收益更高,风险更低,项目风险更可控。 有一家贸易企业准备启动 AI 项目。经过前期讨论,企业找到了三个候选场景: 用 AI 识别销售订单并检查异常; 用 AI 预测库存和生成补货建议; 用 AI 自动生成周度经营报告。 信息化负责人按照之前的六维评估表,对三个场景进行了打分。 智能补货 26 分,订单审核 24 分,经营报告 22 分。 按照评估标准,三个项目都超过了 20 分,都有投入价值。 问题来了: 企业的预算、人员和管理精力,只允许先启动一个,究竟应该先做哪一个? 有人认为应该先做智能补货,因为它得分最高,对库存和现金流的影响也最大。 …
8月19日,2026世界机器人大会在北京亦庄开幕。作为全球机器人产业的重要风向标,本届大会汇集了人形机器人、工业机器人及大量具身智能解决方案。在星炽动力展台,搭载PULSE具身智能系统的机器人正在进行多场景任务演示,观众可以直观看到同一套模型如何在不同环境中理解指令并调整执行策略。 对于星炽动力而言,此次参展的三个关键词——PULSE、多场景与真机数据——相互关联,共同指向一个问题:当机器人离开展馆,进入社区服务、教育科研、商业服务等日常环境,支撑它完成任务并持续适应的能力从哪里来? 从一台机器人,看多场景能力如何复用 展会呈现的是能力切面,真实场景面对的则是不断变化的空间、对象、流程与用户需求。对机器人企业而言,多场景并非简单的场景数量叠加,更考验底层能力的迁移效率。展会现场,星炽动力展示了同一机器人平台在社区配送、科研教学、商业导览等场景的应用案例。其思路是以统一的具身智能底座支撑机器人理解任务、规划行动,并根据环境变化调整执行方式。 这套能力的核心是星炽动力自主研发的PULSE具身智能大模型。按照星炽动力的定义,PULSE是一套由用户意图驱动的世界动作模型,它同时理解物理环境与用…
南京信息工程大学的研究人员在《科学》上发表研究报告,称全球对太阳能发展的推动可能带来隐性的损害生物多样性的代价。可再生能源的扩张有助于应对气候变化,但大规模太阳能开发也可能因栖息地改变或破碎化而导致生物多样性丧失,从而引发新的环境得失权衡。研究人员汇编了一个大型数据集,它涵盖了 2014 年至 2023 年中国的 2344 个县。他们的数据集整合了鸟类观测数据、太阳能政策、环境条件和社会经济信息。他们还考察了土地利用、植被状况和农业生产力变化所带来的影响。研究结果表明,太阳能扩张政策的力度加大与鸟类多样性的显著下降有关:政策强度每增加一个标准差,鸟类生物多样性指数便会下降 2.10%。这些影响在较富裕地区和非沙漠地区最为显著,且对地理分布广泛的物种影响尤为严重。这主要应归因于土地的迅速转化,特别是将农田和草地转化为开发区,后者降低了植被的多样性。
快消品企业库存积压,往往源于销售预测、采购返利、SKU扩张和补货参数失真。文章拆解库存形成的五个节点,说明AI如何参与预测复盘、采购分析、商品调整、库存预警和经营决策,帮助企业在商品入库前识别风险,建立可追溯的库存治理闭环。 一、场景介绍 一家快消品经销企业,代理多个品牌,管理着上千个SKU。 最近,老板发现库存金额连续几个月上升,仓库也快放不下了。奇怪的是,销售仍在抱怨畅销品缺货,仓库里却堆着不少几个月没有销售的商品,有些甚至已经临近保质期。 老板要求仓库加强管理,销售赶快清库存,采购减少下单。 销售说:“这些货是按照客户预测准备的。” 采购说:“不达到数量,就没有价格和返利。” 商品部门说:“新品必须上,老品还有客户在买。” 仓库则认为:“买什么、买多少都不是我们决定的。” 每个部门似乎都有理由。但企业真正需要回答的是: 这些库存最初为什么会被买回来,又为什么没有及时停止补货? 仓库只是商品最后停留的地方。很多库存问题在商品进入仓库之前,就已经发生了。 二、库存管理概念重新定义 本文所说的商品,主要指食品、饮料、酒水、日化等快消品经销商、代理商采购后,用于渠道销售的标准化成品SKU…
阿里巴巴:2027财年第一季度营收2,689.5亿元,同比增长9%;网易Q2净收入301亿元,营业利润121亿元;台积电1.6nm级A16工艺完成开发验证,目标Q4量产;奇瑞汽车:上半年实现收入1432.80亿元,同比增长1.2%;谷歌旗下Waymo为其无人出租车自研定制芯片;三星晶圆代工技术蓝图调整,1.4纳米延后至2029年量产;《2026年人形机器人产业发展报告》8月20日发布;国家药监局批准2款创新药上市;三星据悉将公布超100万亿韩元股东回报计划;中基协:7月新备案私募证券投资基金1763只,新备案规模728.09亿元;许家印被判处无期徒刑,恒大集团、恒大地产等案一审宣判;免部署一键调用,国家超算互联网上线GLM-5.3 API
2026世界机器人大会开展首日,恰逢七夕节,一朵玫瑰花被晨昏线科技展台的机器人送了出去。 这不是一朵为节日准备的“救急玫瑰”,而是一台原本服务于制造场景的机器人,在面对不同任务时完成的一次温暖表达。 通过现场屏幕,观众可自主选择生产主板所需料盘,或发起玫瑰抓取任务。此前,这台机器人面对的是SMT主板生产车间高频、精细的物料上下料任务:在料盘间隙仅有1–2mm的货架环境中,机器人根据WMS仓储管理系统下发的任务指令,结合现场LED定位信息识别目标料盘,完成精准定位、抓取与传递。 图:晨昏线科技工业SMT主板生产车间上下料机器人 而面对玫瑰花枝时,机器人则需要根据视觉感知到的花杆位置与尺寸特征,调整抓取动作。 一个是工业场景中的标准化料盘,一个是纤细的玫瑰花枝。看似不同的任务背后,考验的是机器人能否将对环境、对象和任务的理解,转化为具体行动。 这也正是近年来整个行业不断探索的跨机器人形态智能迁移方向:当机器人更换不同本体、末端执行器和操作方式后,能否依然复用对环境、任务与动作的理解。 晨昏线科技正在用自己的方式回应这一问题。 在2026世界机器人大会上,晨昏线科技提出“1×N+1”这一核心…
KCD Hangzhou 2026 将于 11 月 28 日在杭州举办,即日起面向社区征集演讲议题,截止时间为 9 月 30 日。 杭州是阿里巴巴和 DeepSeek、宇树科技等多家人工智能企业的诞生地,也是全国首批"国家新一代人工智能创新发展试验区",云原生与 AI 的开发者社区在这里都有深厚积累。11 月,我们期待与大家再次相聚杭州,围绕 Agent 时代的云原生技术展开交流。 会议信息 会议背景 KCD(Kubernetes Community Days,Kubernetes 社区日)是由社区组织的活动,汇聚开源和云原生领域的采用者和技术人员,旨在促进教育、协作和交流。KCD 活动由云原生计算基金会(CNCF)提供支持。 大会主题 Cloud Native in the Age of Agents:当云原生遇见 Agent AI Agent 正在重塑软件的构建方式和运行形态。从 MCP 协议到推理引擎优化,从 Agent 沙箱隔离到多 Agent 编排,Kubernetes 正在成为 Agent 工作负载的标准运行时,CNCF 生态中的 OpenTelemetry、Envoy、K…
AI 行业可能很快就要面对一个过去听起来有些荒诞的问题:半年后的 H100 算力值多少钱? 过去两年,围绕 GPU 的讨论大多集中在“够不够用”:大模型公司抢 GPU,云厂商扩数据中心,创业公司排队租算力,资本市场则不断计算 NVIDIA 还能卖出多少张卡。但现在,问题开始从“有没有 GPU”,转向“GPU 算力应该值多少钱,以及如何提前锁定这个价格”。 2026 年 8 月,美国商品期货交易委员会(CFTC)正式就 compute derivatives(算力衍生品) 公开征求意见",讨论现货算力市场、市场操纵、客户保护以及 perpetual compute futures(永续算力期货) 等问题。CFTC 主席 Michael Selig 更直接表示,美国如果希望在 AI 竞争中保持领先,就需要一个健全的算力衍生品市场。 这并不是监管机构凭空设想出来的新金融产品。就在此前,CME Group 与 AI 算力市场基础设施公司 Silicon Data 已经宣布",计划推出以 NVIDIA H100 和 B200 GPU 租赁价格为基础的期货产品。Silicon Data 刚刚完成 …
当多数企业将资源倾注于安抚不满用户时,弗罗斯特研究所的数据却揭示了一个反直觉的真相:提升中立者的体验能带来9倍收益。本文从NPS分类出发,结合行为心理学,探讨为何我们总被负面信息牵引,以及如何重新分配注意力,实现口碑增长。 本周参加公司OKR同步会时,看到将提升NPS(净推荐值)指标作为公司FY25规划的主目标之一,我个人理解这意味着公司将核心放在追求良性的低成本增长模式上,即通过客户口碑来实现企业增长。 落脚到产品的层面上,我们需要考量如何通过提升产品功能体验、用户操作体验及中后台服务体验来强化用户忠诚度,形成忠诚用户群体后,才有可能实现高NPS指标带来的口碑转化。 但结合项目期间遇到的一些资源问题,想聊下我个人的看法。 我们都知道,NPS的评估方法会通过意愿推荐程度将用户分为如下三类: 0-6分(贬损者):对产品不满意或没有忠诚度,容易流失; 7-8分(中立者):总体满意但并不忠诚,可能会推荐,但也会考虑其他竞品; 9-10分(推荐者):对产品满意,忠诚度高,会继续为产品付费并推荐给他人。 我们通常不太关注那些打9-10分的推荐者,他们很爱我们的产品,对我们的服务很满意。然而,我们…
Cloudflare 发布了一项开发者预览功能,允许任何网站通过一个面板开关启用 WebMCP(Web 模型上下文协议)接口"。这使得基于浏览器的 AI 智能体能够通过结构化工具与未经修改的网页进行交互,而非通过抓取或猜测,从而将人类流量和控制权保留在原网站上。 WebMCP 的核心理念是通过标准协议,直接向 AI 智能体提供结构化、机器可读的工具。这使得它们能够调用诸如 searchFlights 或 bookTicket 之类的显函数,而不需要依赖消耗令牌的 HTML 抓取和解析,也不需要点击 UI 按钮来触发操作。与传统浏览器自动化相比,WebMCP 使交互速度更快、效率更高,而且稳定性更强——传统自动化方案往往会在 UI 发生变化时失效。 要采用 WebMCP,网站必须将其功能以工具的形式对外提供,具体可通过以下两种方式实现:一是使用 document.modelContext API"(开发者可以用它注册工具、定义模式并编写实现代码);二是使用一种声明式 JavaScript API"(开发者可以通过在标准 HTML 表单中添加注解来创建 WebMCP 工具)。 该预览版功能…
2026 年,智能体将在企业级应用中取得哪些实质性突破?点击下载"《2026 年 AI 与数据发展预测》白皮书,获悉专家一手前瞻,抢先拥抱新的工作方式! 大多数数据工程师都试过把一个 Coding Agent 指向自己的 SQL,然后得到一些“看起来有用”的结果。样板代码变少了,搭架子更快了,信号很明确:Agents 和数据工作天然是契合的。 但很快就会出现一种更难描述的挫败感,它不像幻觉那样明显,也不只是因为查询写错了。Agent 生成出来的内容从表面上看没问题,语法正确、风格也符合惯例,但它并不真正适合你的实际环境。它不知道哪些表是生产表,哪些 Schema 是受治理的,也不知道你的 RBAC 结构是什么样。结果就是:你拿到了一份还得继续人工重塑的代码,它离真正可用还差很远。 问题不在模型本身,而在于 Agent 运行时脱离了让数据工作变得“具体”的上下文。 Coding Agents 天生适合做数据工作 它们带来的价值是真实存在的。数据工程里有大量模式化工作:流水线脚手架、增量转换逻辑、重复性的 SQL join、遵循固定套路的迁移脚本。一个好的 Coding Agent 能够很…
当下,实体网点、展厅、门店等普遍面临人力成本高企、人员流动带来服务标准难以统一、高峰时段服务供给不足等现实问题。传统云端数字人方案受网络条件制约,同时存在业务数据外溢、交互时延波动等风险,一定程度限制了AI数字人在线下场景的规模化落地。近日,中科通量发布OmniMate移动AI数字员工产品,依托本地边缘智能架构,面向线下实体空间提供可移动、多岗位复用的AI数字劳动力解决方案。 OmniMate并非传统意义上的服务机器人或信息屏终端。从产品架构来看,其核心是一套“边缘智能主机+多模态交互系统+可扩展业务软件”的通用型数字劳动力平台。 中科通量将其定位为一岗多职的本地AI数字员工,意在替代或辅助网点中高频、重复、标准化程度较高的服务职能。据企业方面介绍,该产品已完成在通信营业厅、科技展厅等场景的部署验证。 一岗多职,解锁线下服务全场景能力矩阵 从功能维度看,OmniMate覆盖了线下服务中“迎宾讲解—培训赋能—获客引流—管理提效”的关键环节: AI大堂经理:支持多语言交互、视觉感知与复杂产品讲解,可承担主动迎宾、业务导览、问答咨询等职责,旨在统一服务口径,降低因人员差异导致的体验波动。 A…
2000辆Robotaxi,把中国自动驾驶公司的海外竞争推向新高度。 8月14日,小马智行宣布进一步扩大与Uber的合作,双方计划在欧洲五个城市部署超过2000辆Robotaxi。 据悉,克罗地亚首都萨格勒布将率先接入Uber平台,用户通过Uber App即可呼叫小马智行Robotaxi,此后双方还计划继续扩大在欧洲和中东的运营版图。如此一来,小马智行海外部署规划总规模超过4000辆Robotaxi。 双方于去年5月首次合作,计划在中东及更多国家部署Robotaxi,而合作方Uber,此前已经参与全球Robotaxi商业化多年。 这意味着,以小马智行为代表的中国自动驾驶公司,正在进入全球Robotaxi成熟的商业运营体系。 小马智行,决定Robotaxi的生意上限 Waymo于2018年12月首次推出商业化Robotaxi服务,如今已经建立全球最大规模的Robotaxi车队,超3800辆Robotaxi在美国15座城市行驶,每周为其贡献超50万份订单。 但Waymo目标远不止于此,预计2026年在美国实现每周百万份Robotaxi订单,并将商业化运营扩展至美国及海外共20个城市。 如今…
宇树的下一张牌,是搭起一套系统,让全球 AI 的持续进步,转化为机器人不断加快的进化速度。 作者 | Li Yuan 8 月 19 日,宇树科技正式登陆科创板。上市首日,公司股价一度较发行价涨超 6 倍,总市值突破 4400 亿元。 当市场盯着这家「机器人身体最强公司」的股价时,一个更重要的问题随之出现:获得更多资金和资源之后,宇树接下来要做什么? 当天中午,王兴兴参加了宇树的上市答谢午宴。这几乎是公司上市后的标准动作:感谢一路支持的政府、股东和合作伙伴,再回望一遍创业十年的艰辛。 但在略显磕巴地完成这些常规致谢后,王兴兴没有就此结束,而是突然把话题转向技术,开始讲述宇树上市后真正准备投入的一套系统。 他的状态也随之变化。表达明显流畅起来,语速越来越快,从大模型讲到自动编程,从仿真训练讲到真机测试,再讲到机器人技能的自我进化。 显然,这部分内容他已经想了很久。 01 当 AI 进入机器人研发全过程 王兴兴讲的并不是宇树即将发布的某个模型或产品,而是他对机器人技术下一阶段的判断:只做一个 AI 模型或者视频模型,整体竞争力和迭代速度已经不够。下一阶段真正重要的,是能否把模型、工具、仿真、…
一个尚未发布的模型,已经具备接近“关键级”的网络攻击能力,另外一边,已经有一个内部模型则在安全测试中逃出沙箱、利用零日漏洞入侵了 Hugging Face。面对能力增长超出安全设施承载范围,OpenAI暂停了部分强化学习训练。 2026年8月18日,OpenAI 罕见地公开承认:为了升级安全、监控和对齐体系,公司曾暂停最新一代模型的强化学习训练两周。 Altman 在 x 发文称,暂停了一些前沿强化学习训练,以确保能够满足针对当前模型新能力水平所需的对齐、安全和监控标准。模型进展目前非常迅速,OpenAI 一直强调,如果认为模型存在问题,将采取行动。 截至公告发布时,规模最大的前沿强化学习训练仍未恢复。 之所以这么做,原因很简单——一个即将推出的模型(官方披露的模型代号是“Astra”)可能已达到“关键级”网络安全能力,而现有研究基础设施、监控和对齐措施尚不足以完全覆盖相应风险。 但是,这并不意味着模型的全部训练已经停止。小规模训练、能力评估和安全验证仍在进行。 导火索是一次真实入侵 OpenAI踩下刹车,并不是出于某种抽象的未来担忧,导火索是一场已经发生的网络安全事件。 2026年7…
近期微软(Microsoft)和亚马逊(Amazon)的两场财报电话会议共同印证了一个趋势:基于Arm架构的定制芯片已经从过去的技术尝试,转变为超大规模云基础设施的核心支柱。 微软CEO萨提亚·纳德拉用一句话概括了这场架构变革:“在运行智能体负载时,CPU与GPU同样重要。”随后他给出了有力的证据:微软预计,到7月底搭载Azure Cobalt 200的机架将部署在全球超过25个数据中心。 时隔一日,亚马逊公布,其芯片业务(包括Graviton、Trainium和Nitro)年化营收规模已突破250亿美元,同比增长达到三位数。客户对Graviton的采购承诺规模环比接近增长三倍,而Graviton5的采用速度也接近Graviton4的两倍。 虽然产品不同、云平台不同,但方向趋同:全球领先的超大规模云服务商正在将基于 Arm 架构的 CPU 打造成AI基础设施的核心,并针对各自的工作负载需求和经济效益目标进行优化。 智能体需要的不止是模型算力 生成式AI的第一波浪潮的衡量标准是模型规模、AI加速器的供给能力以及词元(Token)的生成能力。而智能体AI的运行方式则更加复杂,智能体需要检索…
七夕婚姻登记高峰将至,支付宝政务 AI 助手 “晓政”联合民政部民政通推出婚姻登记专项便民服务,依托 MCP 能力连接十省官方服务通道,为用户提供结婚登记预约、政策咨询、婚姻登记网点查询等服务。用户无需在多个页面反复查找,只需说出“预约结婚登记”等需求,即可快速获取对应服务及办事指引,让婚姻登记从“找服务”进一步走向“对话办”。 此次婚姻登记智能服务通过MCP接入民政通官方服务能力。针对登记条件、办理材料、办理流程、异地登记规则等高频问题,晓政还可提供AI问答和办事指引,并支持婚姻登记网点查询,帮助用户提前了解办理要求、减少重复查找。通过连接真实政务服务,晓政正推动AI从信息咨询进一步进入实际办事流程。 作为支付宝深耕数字政务领域的标准化解决方案,晓政自2025年9月正式上线以来,依托多融合大模型能力与成熟的智能服务架构,实现从“人找服务”到“服务找人、对话即办”的核心转变。目前,目前,晓政已助力100余家部委及省级政务机构搭建智能体,覆盖16000项政务服务事项,涵盖人社、公积金、公安、不动产等高频民生场景,累计服务次数突破1亿次,逐步形成可复制、可迭代的智能政务服务能力。 此次婚姻…
2026 年,智能体将在企业级应用中取得哪些实质性突破?点击下载"《2026 年 AI 与数据发展预测》白皮书,获悉专家一手前瞻,抢先拥抱新的工作方式! 我构建了一个 FIFA World Cup 2026 应用,它包含实时比分、淘汰赛对阵生成器、交锋统计、场馆地图、比赛预测等功能,而且整个过程几乎完全是通过与 Cortex Code Desktop(CoCo)的一系列自然语言对话完成的。 之所以花了几周时间,是因为一开始我完全没有任何样板代码;同时随着赛事推进,我也不断想把新的想法、更好的交互和更多实时统计数据迭代进来。 首页就是一个典型例子:它最初只是一个静态倒计时卡片,后来通过纯对话式开发,逐渐长成一个实时 dashboard。 一开始它只有四个指标卡片(距离开赛天数、剩余比赛场次、48 支球队、16 个场馆)和一个赛程 dataframe;后来又加上了实时比赛卡片,以及带动画的统计 pills(控球率、射门、角球)和进球/黄牌/红牌事件标记;接着加入了下一场比赛的 JS 倒计时,以及当多场比赛同时开踢时的多卡片堆叠显示;然后加入了纵向淘汰赛 bracket,并叠加了以金色 ba…
IEEE Spectrum 发表了一篇文章纪念了今年五月去世的数字信号处理先驱刘必治。刘被广泛认为是现代数字信号处理领域的奠基人之一,其研究推动了声音、图像和视频处理从模拟到数字的转变。尽管在工程界之外鲜为人知,但全世界数十亿人使用的技术都包含了他的研究成果,让手机通话、流媒体视频和互联网通信成为可能的低功耗数字信号处理器,其技术基础可追溯到他在 1970 年代和 1980 年代开展的研究。刘于 1934 年出生于上海,后随家人迁往台湾,他的父亲 Henry Liu Sr. 是一名电机工程师。他于 1954 年在国立台湾大学获得电机工程学士学位,毕业后随家人迁往美国,他与父亲一起就读于布鲁克林理工学院(现纽约大学 Tandon 工程学院),两人在 1956 年一起获得电机工程硕士学位。刘之后继续深造,四年后获得电机工程博士学位。他在 1962 年加入普林斯顿大学。他与其前研究生 Abe Peled 在 1976 年出版了教科书《Digital Signal Processing: Theory, Design, and Implementation》,该书是工程师的标准参考书,定义了数…
具身智能产业关注的重点正从“能力涌现”进入“生产力兑现”阶段,拼的不只是单一模型能力。8 月 19 日下午,在北京举行的 2026 世界机器人大会上,百度集团副总裁袁佛玉表示,机器人从“会展示”到“能上岗,需要模型、数据与应用协同形成的系统能力。 百度集团副总裁 袁佛玉 模型从理解语言,走向理解和预测物理世界 机器人真正进入物理世界,仅理解语言并不够,还要理解物体关系、动作后果及环境变化。随着 VLA、世界模型和运动控制加速演进,计算工程系统也面临更高要求。 袁佛玉指出,依托百度百舸 AI 计算平台,百度智能云持续完善面向具身智能的 AI Infra,支持企业完成从数据处理、模型训练、仿真评测到真机推理部署的研发全流程,推动模型从研究原型走向工程系统;在部分合作中,单步推理延迟已进入百毫秒以内区间。 数据从训练材料,变成具身智能最核心的生产要素 具身数据采集成本高、标准不一,且与具体本体、任务和环境高度相关。 袁佛玉认为,未来的重要竞争要素,在于企业积累了多少有效任务小时、捕获了多少高价值失败样本,以及形成了多少能够回流训练的数据。相比重复完成同一动作,失败、纠正、人工接管和边界案例数…
过去几年,大模型竞争的主线很清晰:更大的模型、更多的数据和更强的GPU集群。 但随着预训练边际收益递减,模型能力Scaling正从单纯的预训练堆叠向后训练强化学习(RL)转变,数学推理、代码生成、复杂决策、长时序Agent等高阶能力,越来越依赖后训练强化学习(RL)激发。RL通过生成、执行、反馈和奖励,让模型持续学习推理、规划与自我纠错的能力。 由此,大模型发展从“一次性训练”进入“持续训练”,模型能力Scaling也从预训练延伸至生成、反馈和迭代全过程。SemiAnalysis指出,当RL成为模型能力持续Scaling的关键,竞争的就不只是算法,还有支撑模型持续生成、训练和更新的AI基础设施系统。 问题也随之变成:当模型越依赖RL获得能力,谁来支撑这种能力持续低成本地生产。 从“模型+算力”到算法与AI基础设施共同Scaling 智谱近期的模型迭代,为观察后训练RL提供了一个窗口。 智谱公告指出,GLM-5.3与GLM-5.2在相同基座上推进强化学习,通过后训练Scaling持续提升模型智能上界。以GLM-5.2为例,其在SWE-bench Pro取得62.1分、Terminal-B…