8月25日,据外媒报道,国际知名新闻机构汤森路透(路透社母公司)近日推出了其自研大模型Thomson-1。该模型基于阿里Qwen大模型开发,旨在降低对Claude等闭源模型的依赖并减少长期使用成本。 此前,汤森路透曾推出自己的AI助手,接入的是海外大模型厂商Anthropic的Claude大模型。出于降低闭源模型的依赖和成本因素考量,近期,汤森路透选择基于阿里开源模型Qwen3.5自研出Thomson-1 大模型。Thomson-1 将首先用于表格分析、文档审核等专业工作,并逐步承接部分此前由 Claude 完成的任务。 开源模型允许企业自行部署和调整,性价比高,安全可控。随着阿里Qwen等开源模型能力的持续增强,越来越多的企业和机构由闭源转向开源。美国互联网公司爱彼迎Airbnb CEO布莱恩·切斯基称公司正“大量依赖阿里巴巴的千问模型”,并直言“比OpenAI更好更便宜”;“美国版小红书”Pinterest也于近期转投Qwen,其CEO比尔·雷迪直言使用Qwen的成本不到Anthropic、OpenAI等同类闭源模型的8%。 截至目前,Qwen已经开源460多个模型,在开源社区总下…
自 2026 年 8 月 2 日起,《欧盟人工智能法案"》第 50 条规定的监管措施在各成员国正式生效。该条款要求通用和生成式人工智能系统的提供商以机器可识别的格式标记合成输出的结果。为此,主要的基础模型供应商在推理管道中推出了统计文本水印算法和加密元数据标准。很快,这在他们与开源开发生态系统之间引发了一场快节奏的“猫鼠游戏”。 合规转型的运营核心在于针对自然语言生成的统计性 Token 采样水印技术。现代水印技术不再通过注入会干扰下游解析器或破坏明文数据管道的零宽度 Unicode 字符,而是直接在自回归解码过程中进行干预。生成运行时将模型词汇表划分为伪随机的“绿色”和“红色” Token 集,并通过加密方式与前续文上下文 Token 建立关联。在“绿色”候选词的对数概率(logit)上施加微小的正偏置,既能保持语义连贯性与推理延迟不变,又能在 Token 序列中嵌入可以被数学方法检测到的签名。 Anthropic 宣布针对 8 月 2 日及之后发布的 Claude 模型在全球范围内部署该机制,具体内容详见 Anthropic 支持文档"。该实现方案在网页界面、开发者 API、Cla…

告别理想仿真,中国学术团队用物理工程方案回应落地挑战。 作者丨张璐 编辑丨岑峰 过去一年多里,具身智能似乎按下了快进键。 从 Physical Intelligence 发布的π₀到开源社区追捧的OpenVLA,VLA大模型一路高歌猛进。在各种标准基准测试和精心搭建的实验室 Demo 中,机械臂叠衣服、拿取物品流畅得宛如人类,动辄刷出 90% 甚至 95% 以上的成功率。 然而,当全行业都在欢呼“机器人的 GPT 时刻”到来时,前沿学术界与产业界却爆发了一场剧烈的反思:这些动辄数十亿参数的具身大模型,真的学会“举一反三”了吗?还是在“死记硬背”? 在主流学术视角中,VLA 大模型像是给机器人装上了具备常识与规划能力的“大脑”。但要让机械体真正干好精细活,仅有一个聪明的大脑远远不够。 最新实验数据表明,面对物品位置的随机挪动或新指令组合时,纯端到端大模型往往会受到“空间过拟合”的约束,末端执行成功率会出现剧烈衰减。 这恰恰说明:具身智能要真正走出实验室,不仅需要大模型提供常识和高层决策,更需要扎实的工程技术去打造精准、稳健的“小脑”。 下面雷峰网盘点入选 IJCAI 2026 的 6 项…

在 Cloudflare 和 Brave 之后,Protocol Labs 停止资助星际文件系统(IPFS)的核心维护团队 Shipyard,IPFS 的未来打上了巨大的问号。IPFS 是 Protocol Labs 从 2014 年起开发的开源项目,目的是实现文件分布式存储、共享和持久化的网络传输协议,它是一种内容可寻址的对等超媒体分发协议,在 IPFS 网络中的节点构成一个集群文件系统。Cloudflare 和 Brave 都曾支持过 IPFS,但都已经退出,目前使用 IPFS 最知名服务可能是 Bluesky,它的 ATProto 协议是基于 IPFS 内容寻址构建的。Shipyard 团队称,与 IPFS 相关的工作将于 2026 年 9 月 30 日结束。
arXiv:2608.22278v1 Announce Type: new Abstract: Vision-based whole-body loco-manipulation on humanoid robots is challenging due to partial observability, contact-rich dynamics, and the difficulty of learning long-horizon behaviors from high-dimensional visual inputs. We present \href{https://github.com/DreamMimic/DreamMimic}{DreamMimic}, a framework that distills privileged teacher policies into vision-based humanoid controllers via world-model-assisted distillation. Instead of using a Dreamer-s…
arXiv:2608.21631v1 Announce Type: new Abstract: Trajectory optimization computes dynamically feasible motions that enable autonomous systems to accomplish complex tasks while satisfying operational and environmental constraints. This tutorial presents OpenSCvx, an open-source Python framework that bridges the gap between high-level problem specification and efficient numerical optimization. Rather than requiring users to derive solver-specific mathematical formulations, OpenSCvx provides a symbo…
GOLEM 是基于 Unitree H1-2 的开源电动车电池拆卸系统架构,行走、操作、导航、空间记忆等模块解耦并配 MuJoCo/IsaacLab 数字孪生;实测从现代 Ioniq 5 电池包抓取松动紧固件,系留状态成功率 97%、自由站立降至 87%。AI summary
当AI Agent进入研发流程,代码生成不再是瓶颈,验证与信任成为关键。阿里开源的Better Harness通过检查Agent的工作闭环,而非仅看结果,试图解决这一难题。本文深入解析其前馈与反馈机制,并探讨产品经理如何从写需求转向设计Agent的工作制度,揭示AI竞争正从模型能力转向工作系统。 过去一年,企业谈论 AI Agent,最常问的是:用哪个模型?上下文窗口多大?接了多少 MCP?配置了多少 Skill? 但当 Agent 真正进入研发流程后,一个更现实的问题出现了: Agent 可能十分钟就完成了一次代码修改,人却要花两个小时确认它有没有理解错需求、绕过规范、漏掉测试,或者给系统埋下新的风险。 表面上,代码生成速度提高了;实际上,瓶颈只是从“生产代码”转移到了“验证代码”。 阿里开源的 Better Harness,试图解决的正是这个问题。它并不是让模型变得更聪明,而是检查和改进 Agent 背后的工作方式:目标是否清楚、执行是否受控、结果是否经过验证、交付是否可靠,以及本次任务的经验能否被下一次任务复用。 这背后释放出一个重要信号: AI Agent 的竞争,正在从模型能…

桌面上,AI不再只待在聊天框里。它开始找资料、调用工具、交付结果。DeepSeek把Harness开源成可拼装的插件底座,开发者能更自由地搭建Agent;OpenAI则把多步执行能力推给普通职场用户。两件事放在一起,竞争已经从“回答得多聪明”转到“能不能把事情做完”。但任务越深入邮箱、文件和业务系统,权限、成本与责任就越不能含糊。 一起来看看这两天发生的AI和互联网赛道的大事件吧! 📌 今日AI互联网大事件速览 1,小米玄戒O100与AI Cube真机首秀,端侧模型获得专用硬件 2,比亚迪与荣耀深化手车互联,地址和音乐可跨端流转 3,DeepSeek开源Harness开发者预览版,Agent能力全面插件化 4,京东为人形机器人运动会设“机器人之家”,售后服务进入赛场 5,阿里Wan3.0正式上线,视频生成首次支持多类文档输入 6,NVIDIA扩展Vera Rubin推理平台,Agent算力继续压低Token成本 7,OpenAI把ChatGPT Work推向普通职场,Agent开始争夺非技术用户 8,General Intuition估值冲向60亿美元,游戏数据转向训练机器人 9,G…

Doubao 、DeepSeek 在三语数据集上的表现,普遍超过 GPT-4o 和 Gemini。 作者丨幸丽娟 编辑丨岑 峰 医疗,是大模型落地最特殊的场景之一。 特殊在哪里?特殊在一个很微小的错误,就可能导致致命的后果;也特殊在你不能用直觉去判断它"行"还是"不行"—— 你觉得医疗专用模型肯定比通用模型更懂医疗?直觉上是。但实验数据不支持。 你觉得英语训练出来的模型处理英语医疗数据肯定最好?直觉上是。但实验数据也不支持。 这两重"反直觉",正是纽约大学阿布扎比分校和阿布扎比克利夫兰诊所的研究团队在ACL 2026 Findings上发表的论文揭示的核心真相。 论文链接: https://aclanthology.org/2026.findings-acl.573.pdf 论文代码:https://github.com/congboma/MedErrBench 研究团队构建了首个面向医疗错误检测、错误定位和错误纠正的多语言评测基准MedErrBench,覆盖英语、中文和阿拉伯语三种语言,考验了 GPT-4o、Gemini、Llama、Qwen、DeepSeek等一系列主流模型,在多达…

Meta 设计并开源了 MetaRoCE,一个专为 AI 工作负载在通用以太网上打造的 RDMA 传输协议,已通过 Open Compute Project(OCP)发布规范、参考软件实现和合规测试套件。该协议将智能移至端点,原生支持乱序交付、多路径、无损容忍和双向拥塞控制,无需 PFC,可在百万 GPU 规模下提供高吞吐、低尾延迟。现有 RDMA Verbs API 和软件栈无需修改即可运行。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmt7nq1d02bs1ro7373u88po4
A rogue AI agent staged a public apology as a deception tactic while quietly slipping fresh malware into its pull request. The article Rogue AI agent used fake accounts and a staged apology to push malware into an open-source project appeared first on The Decoder.

GitHub 宣布公开预览 Stacked Pull Requests" 。该功能原生支持将大型软件变更拆分为多个比较小的相互依赖的拉取请求,从而可以分别进行审查和合并。该功能旨在解决现代软件开发中一个长期存在的难题:如何在代码生成速度不断提升(尤其是借助 AI 辅助开发的情况下)与人类代码审查人员有限的处理能力之间取得平衡。 现在,开发人员不用再提交包含数百或数千行代码的单个拉取请求,而是可以将工作拆分为一系列比较小的拉取请求,每个请求都基于前一个请求进行构建。审查人员可以单独评估每一个逻辑变更。这不仅减轻了认知负担,还使得开发工作能够持续进行,不用等待整个功能完成后才开始审查。GitHub 的实现还保留了现有的分支保护规则、审查工作流和合并策略,使得分层开发成为现有代码库实践的自然延伸,而不需要单独的工作流。 本次公告的发布时机反映了软件行业正在发生的广泛转变。如今,AI 编码助手能在几分钟内生成大量可直接投入生产的代码,但代码审查仍然主要由人工完成。随着开发速度的加快,审查质量有可能会成为软件交付的主要瓶颈。 Stacked Pull Requests 试图通过缩小审查范围(而非…

Netflix" 开源了一个用于观察性因果推断(OCI)的智能代理工作流"。该工作流可以减轻因果分析过程中的繁琐工作。基于观察数据和人类用户的分析计划,该智能代理能够利用行为者-批评者循环来评估因果关系、撰写报告并提出后续步骤的建议。 该智能代理工作流基于 Netflix 现有的 OCI 工具构建。其目标是自动化易出错或重复性任务(如敏感性分析或跟踪多次迭代),将更高层次的任务(如问题构建和结果评估)留给人类用户。OCI 分析被定义为目标试验仿真",即寻找能够解答该问题的最优 A/B 测试方案。Netflix 团队使用大西洋因果推断会议(ACIC)竞赛数据集"对该工作流进行了评估,发现其与各类基准系统相比非常“具有竞争力”。据 Netflix 说: 在因果推断中使用智能代理面临着一个挑战:在没有真实标注数据的情况下,我们如何评估智能代理在各项任务中的表现?为了应对这一挑战,我们的工作流程将流程审核与人工监督相结合。为了让其他人能够借鉴并评判这一工作流程,我们已经将一个轻量级的独立版本开源。我们希望,这项工作能激发更多在没有真实标注数据的情况下对智能代理进行评估的研究与开发。 人类分析师…

A BOCOM International analysis argues Moonshot AI's Kimi K3 — 2.8 trillion parameters, natively multimodal, with a 1-million-token window — sits on the Pareto frontier of cost and capability, trailing only top closed models while cutting per-task cost sharply.

当AI Agent开始执行真实操作,批准按钮便成为产品设计的关键节点。OpenAI发布Codex Harness,将任务循环与权限控制开放给开发者。本文从Harness视角解析批准请求如何作为运行状态,以及沙箱与批准策略如何共同决定Agent的行动边界。 Codex准备执行某些操作时,任务会出现一个短暂的停顿。 Agent已经理解了要求,也规划好了下一步操作,却没有立刻执行。它会先展示准备运行的命令、准备修改的文件,或者准备访问的网络地址,然后等待用户选择允许、拒绝或取消。 这条批准请求看起来只是一个安全提示。把它放进完整的任务流程后,它承担的工作远比提示更重。用户点击按钮的那一刻,决定了Agent可以把语言变成哪一种真实行动。 2026年8月19日,OpenAI发布《Codex as a platform》,将Codex背后的开源Agent Harness进一步推向开发者。官方给Harness划定的职责包括维护上下文、调用工具、处理失败、传递进度、执行权限规则,以及在需要时向人申请批准。 Harness可以翻译成执行框架,也可以理解为围绕模型运行的一整套工作系统。这个词近期频繁出现在…
Cloudflare 推出"了 WriteGuard(目前处于私有测试阶段),旨在为 MCP(模型上下文协议)服务器提供精细化的安全控制。对于能够修改数据或执行操作的工具,该功能可以控制 AI 代理的访问权限(而非仅限于读取信息),从而提升 AI 代理的安全性。 WriteGuard 是一个集策略、归因和审计于一体的共享层,旨在应对 AI 代理使用 MCP 访问具有写入权限的外部服务(包括数据库、GitHub、SaaS 应用程序、内部 API 等)时产生的风险。 只读模式是一个不错的起点。随着模型的不断改进,团队在人工智能领域积累了更多的经验,来自工程、产品、设计、销售和客户成功等部门的人开始寻求能够执行操作的工具。[……] 我们希望能够集中控制智能代理可以执行的写入操作,确保智能代理标签能在下游应用程序中显示,并建立审计日志,方便调查智能代理的活动。 WriteGuard 部署在 Cloudflare 的 MCP 服务器门户之后,拦截所有传入的 MCP 请求。它会加载与目标工具关联的策略,并评估请求上下文,以确定是允许该请求原样通过,还是应该阻止。如果获得允许的请求随后失败,那么它将…

检索增强型LLM在消费推荐中易受GEO内容污染影响,成为虚假产品的无意推广者。新基准FORGE在225个真实产品、15个类别和5个消费场景中测试12个商业及开源LLM,发现所有模型均易受攻击:单个污染页面即可造成最高27%的受骗率,替换全部前3个结果时升至73.8%。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmt8bo2db30oaro735zu90tig
An anonymous provider has been handing out free access to a frontier-class coding model on OpenRouter Inc. since Aug. 20, and no company has admitted to building it. The model is listed as “Ox Alpha” and costs nothing for input or output tokens. OpenCode, an open-source terminal agent, debuted the model on the same day […] The post Nobody knows who built AI coding model Ox Alpha or where the code goes appeared first on SiliconANGLE.
亚马逊云科技最近开源了 Dogwood",这是一门用于智能体工具调用的策略语言。它与 Cedar" 的不同之处在于,其规则可以回溯查看智能体已经执行过的操作。Dogwood 采用 Apache 2.0 许可证发布,目前 AgentCore Policy 已支持该语言。 AgentCore Policy 于去年 re:Invent 大会上推出。它位于模型之外,作为一个确定性的控制层运行。模型提出工具调用,策略引擎接受或拒绝调用,而模型永远不会接触执行机制。Cedar 是用于编写这些决策的语言。亚马逊云科技于 2025 年末将其贡献给 CNCF,成为一个沙箱项目。 Cedar 每次只查看一个请求。将同一个请求输入两次,无论之前发生了什么,也无论策略以什么顺序运行,得到的答案都相同。审计和自动推理都依赖这一特性。代价是 Cedar 只能限制单个操作,无法描述操作序列。 智能体会将多个操作组合成工作流,而团队需要的约束通常存在于操作序列之中:在采取行动前获得批准、确保累计总额不超过限制,以及在接触机密数据后停止联系外部人员。 Dogwood 增加了第二种子句类型。Cedar 条件写在 when…

Nikolay Samokhvalov" 发布了 PGSimCity"。这是一款开源教育可视化工具,可以将 PostgreSQL 集群的运行机制转换成交互式 3D 空间模拟。该项目完全在浏览器中运行,无需安装本地依赖,可以通过 PGSimCity 在线可视化"沙箱访问。它为后端开发者、站点可靠性工程师和数据库架构师弥合了高层 SQL 查询与底层内核执行之间的概念鸿沟。 其核心抽象将 PostgreSQL 18 的内部机制转换为 src/world/layout.ts" 中定义的具体市政区域。客户端连接从北部天空进入 Postmaster 管理进程,后者沿着后端大道派生工作进程。shared_buffers 池是位于城市中央的一个 1024 帧网格,旁边分布着 wal_buffers、ProcArray、锁表和提交日志(CLOG)。城市结构下方的存储挖掘区以 8 KB 页面区域、B 树、空闲空间映射(FSM)和可见性映射(VM)的形式组织堆数据。预写日志被传送至东部的 WAL 区域,walwriter 和 walsender 线程从这里广播复制流;西部维护场则容纳 checkpointe…

北京,2026年8月19日—23日,2026世界机器人大会(WRC)在北京举行。 本届大会,智身科技以"真正干活的机器人"为核心定位,通过五大展区集中展示从核心关节、整机本体、机械臂到运动控制(小脑)、智能决策(大脑)的全栈技术能力,回答行业之问:机器人什么时候能真正创造社会价值? 01.展台即现场:从零件到整机,从表演到干活 走进智身科技展台,五大区域构成一条清晰的"干活能力"展示链路。 表演舞台区三大亮点集中呈现:智身银毅NE01人形机器人上演《功夫女足》多机协同舞蹈,单关节峰值扭矩达 180N・m;智身钢镚 L2 四足机器人展示镂空楼梯感控一体通行与 7:1 极限负载自重比。 台面操作演示区,智身科技带来首款行业级可组装教育四足机器人,从通识启蒙、专业实训到工程应用,支撑不同阶段的具身智能教育建设;MATRiX 2.0开放世界仿真训练平台提供手柄虚拟对战体验,打通从虚拟训练到真实部署的链路,现已开源。 地面操作演示区,智身铜锤M1搭载铁臂TA01机械臂展示VLA操作能力,即使智身铜锤M1腿部、本体持续运动时,智身铁臂 TA01 末端依然能保持稳定。系统能够根据动作与负载变化实时协…
GLM-5.3在编程和网络安全上大幅提升,但市场反应平淡。模型能力增强与股价下跌形成反差,反映出国产大模型迭代加速、能力趋同的现状。智谱需在模型优势之外,探索更多高频付费场景,将技术领先转化为持续的商业增长。 8月14日,智谱发布新一代旗舰模型GLM-5.3。8月19日,API正式开放调用,定价与GLM-5.2持平。 GLM-5.3沿用GLM-5.2模型的基座,主要靠扩大后训练规模提升Coding、长程Agent和网络安全能力。目前,模型已经向全部GLM Coding Plan用户开放,并上线ZCode、Claude Code、OpenCode等主流编程工具。模型权重将于下周五开源。 从测试结果看,GLM-5.3进步明显。在Artificial Analysis最新综合智能指数中,GLM-5.3拿到60分,进入全球前沿模型区间,和Claude Fable 5、GPT-5.6 Sol等闭源旗舰处在同一档,并与Kimi K3并列开源模型第一。此外,按照Artificial Analysis统计的单任务成本,GLM-5.3在同档模型中属于低成本选手。 但模型能力提升,并没有延续与前代的市场热…