9月4日,国际数据机构(IDC)发布《中国零售云市场份额,2025》 (以下简称为《报告》)。 腾讯云通过整合PaaS、SaaS及CaaS(咨询即服务)能力,形成覆盖平台、应用及AI服务的产品矩阵,以23.4%的市场份额在解决方案市场位居第一。同时,腾讯云2025年零售云收入同比增长16.8%,在头部厂商中增速最快。 报告显示,2025年中国零售云市场规模达135亿元人民币,同比增长12.4%。随着零售企业IT投入由系统建设转向业务价值驱动,PaaS、数据平台及AI服务占比持续提升,行业解决方案能力逐渐成为市场增长核心驱动力,同比增速达13.9%。 面向这一趋势,腾讯云以模型、工程与场景的综合优势,把解决方案能力变成客户现场的真实经营收益,并通过CaaS将行业洞察前置,与客户共创FDE落地新路径。 智能体加速进入真实业务场景 IDC全球研究显示,AI和Agentic AI(代理式AI)正加速融入零售PaaS和SaaS产品,推动智能导购、需求预测、自动补货、智能定价及客户运营等场景规模化落地。 在企业内部,智能体正在接管巡店、补货、客服这类高频运营动作:瑞幸咖啡、好想来正在借助腾讯云智能…

大模型竞争开始拼组织,这一次轮到字节。 8 月 19 日,据晚点 Late Post 报道,Seed 基础模型团队新设 Pretrain Data(预训练数据)、Horizon RL(强化学习)、Product Posttrain-Work(面向办公场景的产品后训练)和 Product Posttrain-Chat(面向对话场景的产品后训练)四个一级部门,分别由李成刚、唐晟宇、秦禹嘉、朱文佳等人负责,均向吴永辉汇报。 雷峰网了解到,四个新部门之下的分支架构与带队人选也已落定,而这些更细的调整,或许更能透露出此次组织变动背后的真实意图。 01 数据和RL开始集中 先看模型能力侧的两个部门。 有接近字节的人士称,Pretrain Data 由原先分散在文本、编程、视觉理解和语音方向的预训练数据团队合并而来,下设文本预训练(沈科)、代码预训练(Xia Xiao)、视觉预训练(林毅)和语音预训练四个分支,统一为 Omni 全模态模型和超大模型供给数据; 负责人李成刚是清华机械系本硕,曾从 0 到 1 搭建字节搜索系统,先后负责今日头条网页搜索和 TikTok 视频搜索的技术工作,其麾下沈科 2…
最近,亚马逊云科技发布了 aws-bench"。这是一个开源基准测试工具,用于评估 AI 代理完成真实 AWS 任务的准确性,例如诊断配置错误、配置基础设施以及运营实时云环境。 该项目声称,他们采用了与传统静态测试环境基准测试不同的方法。该公司表示,使用在一次性真实亚马逊云科技账户中创建的实际资源,可以在一些开发人员和团队经常在 AWS 上执行的工作中更准确地评估智能代理的表现。 每个基准测试都会在隔离的亚马逊云科技账户中部署一个场景,由 CDK 堆栈中定义的一组 AWS 资源组成。当场景就绪后,待评估的智能代理会使用范围限定凭证,在沙箱容器中运行一项任务。任务完成后,结果将通过自动化验证器进行评分。该验证器可以是大语言模型(LLM)评判器,也可以是对实时 AWS 状态进行程序化检查。 该基准测试附带预定义的数据集,包含基础任务和高级任务。这些任务涵盖可观测性、计算与数据、数据库与存储、EC2 多区域、无服务器、流处理与物联网、参考架构以及多服务故障排除等用例。 尽管这次发布主要面向的是人工智能研究人员和模型提供商,但工程团队也可以尝试使用该基准测试,并通过扩展现有的场景和任务来满足自…

最近一年,具身智能行业里的数据采集设备明显多了起来。入局者众多,很容易让人产生一种印象,数采硬件已经没有多少技术含量,做出一套设备似乎并不难。 但过去一年,我们采访了不少具身智能数据公司。一个越来越明显的感受是,行业已经不太缺“快速、大量采数据”的方案,真正稀缺的是能够稳定进入模型训练,并最终带来模型能力提升的数据。 数采设备越来越多,并不意味着高质量的第一视角数据已经变得容易获得。事实上,我们听到过不少因为数据质量问题拖慢甚至影响模型训练的案例。 最近,开源数据集 Xperience-10M 背后的 Physical AI 数据基础设施公司 Ropedia,发布了新一代第一视角多模态采集设备 HOMIE Gen2。 在 HOMIE Gen2 发布之前,Ropedia 的上一代设备已经被用于生产 Xperience-10M。这套数据集开源后,又陆续进入 Qwen、Ai2 等团队的模型训练。 据 AI 前线了解,从第一台原型机到今天的 HOMIE Gen2,Ropedia 的采集设备在约十二个月里迭代了四代。2025 年 6 月,团队用 3D 打印结构件搭出第一台第一视角采集原型机“竹蜻…

机器人世界模型的下一场竞争,可能不是画质,是架构。 作者|Li Yuan 编辑|郑玄 一只机械臂的夹爪明明没有夹住杯子,杯子却像被磁铁吸住一样,跟着夹爪升了起来。这个看似荒诞的问题,正在困扰机器人世界模型,业内甚至将其称为「磁铁式抓取」。 视频生成模型只要让画面看起来合理,就算完成任务;但世界模型不能只追求「像真的」。机器人训练数据大多来自成功演示,模型容易形成捷径:与其理解动作的细微差别,不如按照画面,直接生成最可能的结果。 可在真实世界里,夹爪位置偏移几毫米,就可能让结果从抓起变成碰倒杯子甚至抓空。世界模型真正需要理解的,是动作与结果之间的因果关系。 8 月 27 日,自变量机器人发布下一尺度自回归世界模型 WALL-SS,试图让世界模型从「能用」走向「好用」。WALL-SS 不是一次性生成整个画面,而是通过由粗到细的方式描绘未来,让不同动作真正对应不同结果;同时结合长时记忆机制,实现最长 60 秒连续推演。 测试显示,WALL-SS 连续推演 60 秒后,画面和运动轨迹仍更接近真实视频,动作跟随得分达到 0.29,而 Cosmos3-Nano 为 0.044,其他测试模型干脆为 …
arXiv:2608.15917v2 Announce Type: replace Abstract: Large-scale pre-training has made robot policy fine-tuning increasingly data-efficient, but this progress has largely been driven by datasets and embodiments built around simple parallel-jaw grippers. Dexterous, multi-fingered hands remain comparatively data-starved because real teleoperation is costly to scale, while human hand video is off-embodiment and requires lossy pose estimation and retargeting. We introduce Simulation Pre-training for …
Voice Arena 与 Hugging Face 合作,为 Open ASR 排行榜引入 Monsoon en-IN 和 Monsoon hi-IN 两个评测集,覆盖印地语与印度英语,其中印地语是该排行榜多语言板块首个非欧洲语言。数据集含公开与私有分割,共 4,888 位说话人,并记录 12 项说话人属性,旨在暴露按地区、年龄、性别等维度分布不均的语音识别误差。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtdgo8nh04rurobxlzwr101x
一项新诉讼指控 xAI 使用儿童性虐待材料(CSAM)训练 Grok 模型,这是首个此类指控。原告 Jane Doe 称其幼年遭虐待所生成的 CSAM 图像及 AI 生成的衍生图像被用于训练 Grok,且 Grok 默认将公开的 X 帖子和自身输出作为训练数据。诉讼要求 xAI 销毁所有 Grok 生成的 CSAM 并阻止模型再生成此类内容。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtc05bnj015srome8fm42xy8
The Information 报道,英伟达同意以 129 亿美元收购 Hugging Face。这笔交易仍处于敲定阶段,仍有可能告吹。英伟达是 Hugging Face 的投资者,它在 2023 年参与了 Hugging Face 的 D 轮融资,当时以 45 亿美元估值融资 2.35 亿美元。英伟达去年还提议以 70 亿美元估值投资 5 亿美元,但遭到 Hugging Face 的拒绝。Hugging Face 是开源 AI 生态系统的核心,托管着数百万个可供开发者使用的 AI 模型和数据集。收购该平台有助于让英伟达在 AI 开发者中占据更大的市场份额。
arXiv:2603.15857v2 Announce Type: replace-cross Abstract: Behavioral Foundation Models (BFMs) produce agents with the capability to adapt to any unknown reward or task. These methods, however, are only able to produce near-optimal policies for the reward functions that are in the span of some pre-existing state features, making the choice of state features crucial to the expressivity of the BFM. As a result, BFMs are trained using a variety of complex objectives and require sufficient dataset co…
Google Research 推出 GlucoFM,一款轻量级自监督 CGM 基础模型,采用双流设计分别建模缓慢血糖趋势与短期波动。在四个队列、七项临床预测任务的 14 项评估中,其 PR-AUC 较最优 GluFormer 变体平均高出 5.8 个百分点,并在 PPGR 预测中取得最低 MAE。模型在 109,066 小时无标注 CGM 数据上预训练,具备跨数据集迁移与少样本适应能力。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtaj3732034urovudls0byfe
A Northwestern Polytechnical University team built a fine-grained multimodal emotion dataset that pinpoints the exact seconds an emotion truly occurs.
AI 陪伴产品的用户画像正在被颠覆。外星人角色 Tolan 拥有 120 万月活,超七成用户是 26-40 岁女性,她们在育儿与工作的夹缝中寻求情感出口。本文拆解其刻意去人形的设计逻辑、长期记忆机制与增长路径。 今天分享的产品又是一个 AI 陪伴产品,但很不一样:Tolan,https://www.tolans.com/ 如果只看产品截图,你很容易把 Tolan 归到:给年轻人玩的 AI 陪伴App。 一只圆滚滚、五颜六色的卡通外星人住在手机里。 你可以和它聊天,它会记住你,它有自己的性格、朋友和生活。 看起来有点像把 ChatGPT、电子宠物和皮克斯动画角色揉在了一起。 但创始人 Quinten Farmer 最近透露了一个非常意外的数据: Tolan 最受欢迎的人群,不是大家想象中的孤独青少年。 超过 75% 的 Tolan 用户,是26-40岁的女性。 其中很多人既要工作,又要照顾孩子,甚至还要照顾年迈的父母。 根据 AI 产品数据平台 AICPB 的数据,目前 Tolan 已经有大约120万月活用户。 01 Tolan 不是一个 AI 女友 先解释一下这个产品到底是什么。 第一…

arXiv:2605.00416v3 Announce Type: replace Abstract: Generalist robot policies increasingly benefit from large-scale pretraining, but offline data alone is insufficient for robust real-world deployment. Deployed robots encounter distribution shifts, long-tail failures, task variations, and human correction opportunities that fixed demonstration datasets cannot fully capture. We present Learning While Deploying (LWD), a fleet-scale offline-to-online reinforcement learning framework for continual p…
arXiv:2604.15395v3 Announce Type: replace Abstract: Over the recent years, the field of robotics has been undergoing a transformative paradigm shift from fixed, single-task, domain-specific solutions towards adaptive, multi-function, generalpurpose agents, capable of operating in complex, open-world, and dynamic environments. This tremendous advancement is primarily driven by the emergence of Foundation Models (FMs), i.e., large-scale neural-network architectures trained on massive, heterogeneou…
arXiv:2604.15052v2 Announce Type: replace Abstract: Autonomous robots operating in natural karstic caves face perception and navigation challenges that are qualitatively distinct from those encountered in mines or tunnels: irregular geometry, reflective wet surfaces, near-zero ambient light, and complex branching passages. Yet publicly available datasets targeting this environment remain scarce and offer limited sensing modalities and environmental diversity. We present CAVERS, a multimodal data…
arXiv:2608.23140v1 Announce Type: cross Abstract: Achieving 360{\deg} coverage is critical for the visual perception systems of autonomous vehicles. Fisheye cameras offer a cost-effective solution by enabling full surround coverage with as few as two sensors. However, existing multi-view fisheye datasets are limited, and synthesizing rare corner cases typically requires computationally expensive 3D simulations, hindering the training. While generative models have achieved significant success in …
arXiv:2608.21685v1 Announce Type: new Abstract: This article presents a novel 3D reconstruction and mapping of the interior of the International Space Station (ISS) using 3D Gaussian Splatting (3DGS). Using existing grayscale images from the Astrobee free-flying robot dataset, we construct a full 3D splat of the ISS' Kib\=o or Japanese Experiment Module (JEM). 3DGS has in recent years shown promise in providing novel view synthesis of scenes captured from many images or videos, this article appl…
arXiv:2608.21620v1 Announce Type: new Abstract: This paper investigates wearable-based recognition of human activities and gestures to support Human-Robot Interaction (HRI) in object-handover and assembly-like scenarios. Electromyography (EMG) and Inertial Measurement Unit (IMU) signals were collected using a Myo armband, culminating in a novel dataset introduced as MAGIC-HRI (Multimodal Activity, Gesture and Intention Collection) with a large taxonomy of 53 movement classes, including Brazilian…
2026 年,智能体将在企业级应用中取得哪些实质性突破?点击下载"《2026 年 AI 与数据发展预测》白皮书,获悉专家一手前瞻,抢先拥抱新的工作方式! 你有没有想过,在任意一秒钟里,一个巨大的数据平台内部究竟在发生什么? 对很多公司来说,数据基础设施就像一个黑盒子:数以百万计的数据点被送进去,复杂查询在里面运行,然后报表被吐出来。但一旦系统变慢、成本飙升,或者某个关键 dashboard 突然空白,想找到根因就像在黑暗里摸索。 为了让这个问题更清晰地被看见,实时购物平台 Whatnot 在 Snowflake Summit 2026 上与 Snowflake 同台分享了他们的实践。他们展示了一套现代企业新蓝图:一边是传奇般的 hyper-growth 故事,一边是自动化 AI analysts 和极度清晰的平台监控。这个合作案例说明,现代数据工具可以在巨大的实时压力下,依然让客户体验保持顺滑、可靠且完全可见。 超高速增长的现实:数十亿事件,零容错空间 Whatnot 已经成长为全球增长速度最快的 marketplace 之一。仅在成立最初几年,其增长轨迹就已经超过历史上的电商巨头 e…

Doubao 、DeepSeek 在三语数据集上的表现,普遍超过 GPT-4o 和 Gemini。 作者丨幸丽娟 编辑丨岑 峰 医疗,是大模型落地最特殊的场景之一。 特殊在哪里?特殊在一个很微小的错误,就可能导致致命的后果;也特殊在你不能用直觉去判断它"行"还是"不行"—— 你觉得医疗专用模型肯定比通用模型更懂医疗?直觉上是。但实验数据不支持。 你觉得英语训练出来的模型处理英语医疗数据肯定最好?直觉上是。但实验数据也不支持。 这两重"反直觉",正是纽约大学阿布扎比分校和阿布扎比克利夫兰诊所的研究团队在ACL 2026 Findings上发表的论文揭示的核心真相。 论文链接: https://aclanthology.org/2026.findings-acl.573.pdf 论文代码:https://github.com/congboma/MedErrBench 研究团队构建了首个面向医疗错误检测、错误定位和错误纠正的多语言评测基准MedErrBench,覆盖英语、中文和阿拉伯语三种语言,考验了 GPT-4o、Gemini、Llama、Qwen、DeepSeek等一系列主流模型,在多达…

Netflix" 开源了一个用于观察性因果推断(OCI)的智能代理工作流"。该工作流可以减轻因果分析过程中的繁琐工作。基于观察数据和人类用户的分析计划,该智能代理能够利用行为者-批评者循环来评估因果关系、撰写报告并提出后续步骤的建议。 该智能代理工作流基于 Netflix 现有的 OCI 工具构建。其目标是自动化易出错或重复性任务(如敏感性分析或跟踪多次迭代),将更高层次的任务(如问题构建和结果评估)留给人类用户。OCI 分析被定义为目标试验仿真",即寻找能够解答该问题的最优 A/B 测试方案。Netflix 团队使用大西洋因果推断会议(ACIC)竞赛数据集"对该工作流进行了评估,发现其与各类基准系统相比非常“具有竞争力”。据 Netflix 说: 在因果推断中使用智能代理面临着一个挑战:在没有真实标注数据的情况下,我们如何评估智能代理在各项任务中的表现?为了应对这一挑战,我们的工作流程将流程审核与人工监督相结合。为了让其他人能够借鉴并评判这一工作流程,我们已经将一个轻量级的独立版本开源。我们希望,这项工作能激发更多在没有真实标注数据的情况下对智能代理进行评估的研究与开发。 人类分析师…

面壁智能 OpenBMB 推出 MathForm,一个面向 Lean 4 数学自动形式化的开源框架、数据集与模型。其 FormalVerse 数据集含 367K+ 已验证示例;在匹配 100K 预算下,基于其训练的模型 Consistency Check 达 60.32%,优于 FineLeanCorpus(46.53%)与 NuminaMath-LEAN(41.49%)。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmt2yscvm0ca8ro6t0u6vtfnt
今天,商汤科技正式开源轻量级、原生统一多模态大模型 SenseNova U1.5 Lite。与预览版(U1.5 Lite Preview)呈现的原生统一多模态模型能力相比,正式版更关注的是,这些能力能否更准确、更稳定地进入真实视觉创作流程。 模型重点围绕真实视觉任务重新完善训练数据、任务设计与后训练流程,强化视觉质量、复杂指令遵循、文字与布局、原生4K、图像编辑和精细视觉控制等,提供更高可控性、更高清、更高性价比的能力工具,推动 AI 视觉生成真正跨越到“稳定完成真实视觉交付”的新阶段。 目前模型已面向全球开源,开发者与创作者可直接部署体验。 GitHub:https://github.com/OpenSenseNova/SenseNova-U1 Hugging Face:https://huggingface.co/collections/sensenova/sensenova-u15 魔搭社区:https://modelscope.cn/models/SenseNova/SenseNova-U1.5-8B-MoT SenseNova Studio在线体验:https://unify…
电影圈的“牛来”刚刚火遍全网,大模型圈也来了一头身份不明的“牛”。 今天上午,OpenRouter 没有举行发布会,也没有公布技术报告,只用一个忍者表情放出了一款代号为“Ox Alpha”的神秘模型。“Ox”在英文中正有“牛”的意思,于是,一场属于 AI 行业的“牛来”也开始了。 OpenRouter 对这款神秘模型的介绍很短,基本就一句话概括了:这是一款面向高效编程、长时间 Agent 任务和真实生产环境的前沿模型,拥有100万Token上下文窗口,同时支持文本、图像和视频输入。 除此之外,模型参数、训练数据、架构、基准成绩以及开发团队全部处于保密状态。 神秘模型 Ox Alpha 引发热议 目前能够确定的是,Ox Alpha 并不是 OpenRouter 自己开发的模型。OpenRouter 只负责将用户请求路由给背后的第三方供应商,而后者选择在预览期间保持匿名。 这让 Ox Alpha 在上线几小时后迅速变成一场大型“猜模型”游戏。 从 Google Gemini、小米 MiMo V3 到腾讯混元新模型,不同猜测陆续出现。 更重要的是,在人们试图识别它到底是谁之前,OpenRou…

Meta AI Research 宣布推出 Muse Glimmer",这是一款拥有 300 亿参数的开放权重模型,采用 Apache 2.0 许可证发布。Muse Glimmer 专为始终在线的本地工作流而设计,使开发者无需依赖云 API,即可直接在消费级 GPU 和工作站上运行自主智能体、复杂工具调用、本地编码以及以 LLM 作为评判者的评估。 Muse Glimmer 30B 模型架构和智能体基准测试 为了在严格的内存预算下实现智能体执行能力,Meta 采用了源自其更大型旗舰模型 Muse Spark 的多阶段训练策略: Logit 蒸馏(预训练):该模型使用相匹配的预训练数据集组合,从 Muse Spark 迁移基础推理能力。中期训练:使用包含复杂推理轨迹、交错文本与图像数据以及多步工具调用轨迹的长上下文序列扩大训练规模。后训练对齐:结合监督微调(SFT)、同策略蒸馏和强化学习(RL),优化代码生成、工具使用和结构化规划等多个领域的性能。 一个专用的 18 亿参数感知编码器使 Muse Glimmer 能够原生处理交错的多模态输入,让本地智能体可以在执行代码或自动化工作流期间直…

南京信息工程大学的研究人员在《科学》上发表研究报告,称全球对太阳能发展的推动可能带来隐性的损害生物多样性的代价。可再生能源的扩张有助于应对气候变化,但大规模太阳能开发也可能因栖息地改变或破碎化而导致生物多样性丧失,从而引发新的环境得失权衡。研究人员汇编了一个大型数据集,它涵盖了 2014 年至 2023 年中国的 2344 个县。他们的数据集整合了鸟类观测数据、太阳能政策、环境条件和社会经济信息。他们还考察了土地利用、植被状况和农业生产力变化所带来的影响。研究结果表明,太阳能扩张政策的力度加大与鸟类多样性的显著下降有关:政策强度每增加一个标准差,鸟类生物多样性指数便会下降 2.10%。这些影响在较富裕地区和非沙漠地区最为显著,且对地理分布广泛的物种影响尤为严重。这主要应归因于土地的迅速转化,特别是将农田和草地转化为开发区,后者降低了植被的多样性。
数据库这款有着 60 多年历史的基础软件,正在加速面向 Agent 重构。 8 月 20 日,在 2026 DTCC 中国数据库技术大会上,腾讯云正式发布面向 AI 时代的数据底座 TDSQL Nexa,通过统一入口连接企业分散的多源数据,并为 Agent 提供业务语义理解和权限治理能力。同期,腾讯云还公布了数据库产品在 AI 方向的最新进展,多项能力已进入腾讯内部 AI 产品、开发者及企业生产环境。 腾讯云副总裁王义成表示,Agent 带来的变化,不只是数据库多了一类新用户,数据形态、运行负载、上下文需求和安全边界也随之改变。面向 AI 时代,数据库需要具备多模统一承载、Agent 原生架构、语义与记忆、治理与自治四类核心能力。 (图:腾讯云副总裁王义成在现场发布TDSQL Nexa) 一个入口,让 Agent 读懂企业数据库 企业建设 AI 应用时,数据往往分散在多个技术栈和平台中。一个 Agent 如果需要在多套系统之间查找、调用数据,开发、运维和权限管理都会变得复杂。 此次发布的 TDSQL Nexa,将事务处理、全文及向量检索、AI 计算、大规模分析等能力统一到一个数据平台。…
当大模型困于“见光死”与“幻觉”,他们提前五年埋下的学术草蛇灰线开始爆发。 编辑丨岑峰 在近日公布的国际人工智能联合会议(IJCAI 2026)Tutorial(讲习班)录用名单中,出现了一个极其罕见的现象:清华大学王鑫教授团队,凭借 T9《Beyond Graph Distribution Shifts》与 T11《OOD Generalized Generative AI》同时包揽两席。 在全球顶尖高校与科技巨头云集的 IJCAI 赛场,同一团队拿下“双杀”,不仅彰显了清华在 AI 领域的强势话语权,更向全行业释放了一个强烈的信号:生成式 AI 的下一场技术战役,已经从“大力出奇迹的 IID(独立同分布)拟合”,全面转向了“应对真实物理世界的 OOD(分布外泛化)挑战”。为什么是王鑫团队?这两场看似独立、实则底层相通的 Tutorial,究竟藏着怎样的学术野心与产业图景? 01 大模型的“阿喀琉斯之踵” 大语言模型(LLM)与生成式 AI 在过去几年高歌猛进,但产业界很快撞上了一堵无形的墙:模型在训练数据(分布内,IID)上表现如神,一旦面对真实世界中前所未见的新场景、新结构或罕见…