南京信息工程大学的研究人员在《科学》上发表研究报告,称全球对太阳能发展的推动可能带来隐性的损害生物多样性的代价。可再生能源的扩张有助于应对气候变化,但大规模太阳能开发也可能因栖息地改变或破碎化而导致生物多样性丧失,从而引发新的环境得失权衡。研究人员汇编了一个大型数据集,它涵盖了 2014 年至 2023 年中国的 2344 个县。他们的数据集整合了鸟类观测数据、太阳能政策、环境条件和社会经济信息。他们还考察了土地利用、植被状况和农业生产力变化所带来的影响。研究结果表明,太阳能扩张政策的力度加大与鸟类多样性的显著下降有关:政策强度每增加一个标准差,鸟类生物多样性指数便会下降 2.10%。这些影响在较富裕地区和非沙漠地区最为显著,且对地理分布广泛的物种影响尤为严重。这主要应归因于土地的迅速转化,特别是将农田和草地转化为开发区,后者降低了植被的多样性。
当大语言模型化身为智能体走向真实世界,它们面临的困境,与十年前在十字路口指挥交通的强化学习模型如出一辙。 作者丨岑峰 幸丽娟 编辑丨岑峰 在通往 AGI 的浪潮中,基础模型智能体(Foundation Model Agents)正以前所未有的速度接管各种任务。业界曾普遍乐观地认为,凭借大模型海量的预训练知识,智能体可以无缝适应各种真实场景。 但在现实中,当我们将一个在英文语境下表现完美的智能体,切换到中文或低资源语言环境中时,其错误率往往会呈现断崖式上升。 这种环境切换带来的“智力降级”,真的是大模型时代特有的新问题吗? 在正在进行的 2026 年的德国不莱梅 IJCAI大会的 Early Career Spotlight(早期职业焦点)环节,亚利桑那州立大学(ASU)助理教授魏华给出了一个极具启发性的“降维”视角:今天大模型智能体所面临的脆弱性,本质上与传统强化学习(RL)在物理世界中遭遇的“仿真到现实(Sim-to-Real)”差距如出一辙。 作为长期深耕强化学习与真实世界决策的学者,魏华教授早年曾在腾讯 AI Lab 担任研究员,后于新泽西理工学院和 ASU 任教。早在2017 …
最近,一个名为 J-Space Cognition Suite 的社区项目近日在 X 上快速传播。项目方声称,在完全不修改 DeepSeek V4-Pro-0813 模型权重的情况下,仅通过一套推理时 Harness,就能显著提升模型在多项 Agent Benchmark 上的表现,甚至超过 Fable 5。 不过,这一看起来颇为惊人的结论目前仍缺少最关键的一环:第三方复现。据 ExplainX 梳理,截至8月18日,J-Space Cognition Suite 公布的所有性能提升数据均来自项目方自己的测试,尚未有独立团队在相同条件下复现相关结果。因此,“DeepSeek V4 Pro 已经借助 J-Space 击败 Fable 5”目前仍然只能被视为项目方及社区传播中的主张,而不是已经得到验证的事实。 更容易引发误解的是,J-Space Cognition Suite 与 Anthropic 此前公布的 J-space 研究并不是同一个东西。前者是一套面向 DeepSeek V4 Pro 的第三方 Agent Harness,后者则是 Anthropic 对 Claude 模型内部…
在 OpenAI 披露其模型在 ExploitGym" 基准测试期间逃逸沙箱"之后,Anthropic 开展了一项回溯审计,覆盖 141006 次评估运行。调查评估了多项进攻性基准测试的历史测试,包括 Cybench"、CyberGym" 和 ExploitBench",重点检查了在第三方评估合作伙伴 Irregular 提供的环境中执行的运行。审计发现了三起不同事件",涉及六次评估运行。在这些运行中,由于出口路由配置错误,以及模型在夺旗演练期间攻陷了现实世界中的目标,Claude 模型得以访问公共互联网。 这些事件涉及 Claude Opus 4.7、Mythos 5 和一个尚未发布的内部研究原型。在所有运行中,模型都在专用的隔离测试环境中运行,与 Anthropic 的内部网络和客户数据分离。模型保留了基础的模型级安全训练,但没有配备生产级拒绝分类器和实时滥用监控。系统提示明确告知模型,它们运行在无法访问互联网的离线模拟环境中;然而,网络容器配置错误使出站互联网路径仍然处于活动状态。由于错误地假定所有可访问的 IP 地址都位于评估范围内,模型采用了基本的攻击技术,而没有利用零日漏洞…
当前,工业具身智能的规模化落地正卡在关键瓶颈:预训练模型在真实产线的部署成功率普遍不足60%,吞吐率不及人工,叠加居高不下的运维成本,让“机器人进厂干活”迟迟无法大规模兑现。 这一横亘在实验室与工厂之间的“最后一公里”,正在被一家年轻的创业公司打破。 近日,中科大机器人博士段逸凡宣布在上海创立具身智能公司灵犀智涌,定位于工业级自进化具身智能机器人企业。公司搭建了ROSS Harness与CONWAY工业原生模型协同演进的技术体系,推出第一代工业具身Harness系统ROSS ,以“模型+Harness”架构攻克工业具身智能落地的工程难题,该系统已经亮相第二届世界人形机器人运动会。 98年出生的段逸凡是中科大机器人方向博士,读博期间聚焦具身智能,空间智能等方向,相关研究成果先后发表于RSS、IJRR、ICRA、IROS等国际顶刊顶会,而ROSS Harness正是其学术成果工程化落地的核心产物。 段逸凡博士师从中科大机器人权威专家吉建民教授,此次创立灵犀智涌,段逸凡博士邀请吉建民教授以联合创始人、首席科学家身份加入,与其一同执掌灵犀智涌整体技术路线,形成“学术指导+工程攻坚”的双引擎结构…
Hugging Face 最新研究引入三项测试量化语音识别中的基准优化(benchmaxxing)现象。对 11 个开源 ASR 模型的评估显示,多个高分系统会复现 VoxPopuli 和 LibriSpeech 基准的错误转录文本,即使音频内容与之矛盾。部分模型甚至依赖声学线索识别基准来源,导致其得分高估了真实转录能力。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmt30vskr0e0wro6t19q13yic
Growing public unease about AI is beginning to translate into political and financial pressure, according to a series of recent reports. Axios reported that the National Republican Senatorial Committee warned top AI companies that data center construction is hurting the party’s prospects in a key Ohio election, while Pew Research found that 52% of Americans now say they’re more […]
Meta is bringing Pocket, its experimental AI-powered app for creating and sharing interactive games, to users across the U.S. after quietly testing it in Brazil.
由于海冰融化,巨型鲸鱼如座头鲸进入到了以前难以抵达的东格陵兰沿海地区。这是东格陵兰海洋生态系统发生重大转变的一部分。直到 2006 年该地区才首次记录到座头鲸的踪迹。2007 年记录到了 7 头座头鲸,2024 年船载设备就记录到了 150 头。研究人员结合卫星标记鲸鱼的追踪轨迹和因纽特猎人的证词,估计 2024 年夏天大约有 4000 头座头鲸、6000 头长须鲸和 6000 头小须鲸造访了格陵兰海。这三种鲸鱼在夏季觅食季节至少会消耗 80 万吨鱼类和磷虾。北极原有的鲸鱼要么被迫适应要么被迫离开。
Multiple security researchers reported losing access to OpenAI’s Trusted Access for Cyber program, which grants vetted researchers reduced-restriction access to advanced AI models for legitimate security work. OpenAI confirmed the issue stemmed from a technical error affecting a limited number of users, primarily those located outside the U.S. and Europe, and asked affected researchers to […]
H2D 不及预期之后,拓竹纠集百人团队,新人博士挂帅,向激光雕刻赛道再度冲锋。 作者丨姚单 编辑丨董子博 8 月 13 日晚,拓竹官方披露,将在九月发布一款减材智造产品,迅速在圈内引起了极大的关注。 雷峰网·鲸犀从多个信源处获悉,拓竹即将发布的新品 R1,定位 C 端市场,主打高性价比,剑指 xTool 的核心地盘。不过,外界目前尚不清楚这款产品是否会搭载材质识别等功能,以进一步降低用户使用门槛并提升安全性。 多位消息人士透露,拓竹激光雕刻机项目于 2025 年年底正式立项,由一支独立的年轻团队负责。团队主要通过外部扩招,在今年迅速扩张至 100 余人。项目负责人为一位博士毕业的年轻人,于 2025 年下半年到岗。 事实上,拓竹在激光雕刻机这条路上的研究,至少持续了三年,期间一直有传闻称其产品将问世,但外界久久未看到产品。而在这个方向,头部玩家 xTool 的研发节奏则始终更快。 知情人士向雷峰网·鲸犀透露,拓竹内部一直在持续研究多种激光技术路线,涵盖二氧化碳、蓝光、光纤等不同方案。其中有一款产品在接近上市阶段被叫停,疑似因竞品抢先发布而痛失市场先机。 后来,拓竹转向更复杂的方案,也就…
In studios and cloud dashboards across several Chinese cities, generative video has moved from startling demos into the ordinary machinery of advertising, e-commerce, and internal previews, even as one prominent consumer experiment abroad is quietly withdrawn.
当多数企业将资源倾注于安抚不满用户时,弗罗斯特研究所的数据却揭示了一个反直觉的真相:提升中立者的体验能带来9倍收益。本文从NPS分类出发,结合行为心理学,探讨为何我们总被负面信息牵引,以及如何重新分配注意力,实现口碑增长。 本周参加公司OKR同步会时,看到将提升NPS(净推荐值)指标作为公司FY25规划的主目标之一,我个人理解这意味着公司将核心放在追求良性的低成本增长模式上,即通过客户口碑来实现企业增长。 落脚到产品的层面上,我们需要考量如何通过提升产品功能体验、用户操作体验及中后台服务体验来强化用户忠诚度,形成忠诚用户群体后,才有可能实现高NPS指标带来的口碑转化。 但结合项目期间遇到的一些资源问题,想聊下我个人的看法。 我们都知道,NPS的评估方法会通过意愿推荐程度将用户分为如下三类: 0-6分(贬损者):对产品不满意或没有忠诚度,容易流失; 7-8分(中立者):总体满意但并不忠诚,可能会推荐,但也会考虑其他竞品; 9-10分(推荐者):对产品满意,忠诚度高,会继续为产品付费并推荐给他人。 我们通常不太关注那些打9-10分的推荐者,他们很爱我们的产品,对我们的服务很满意。然而,我们…
2026 年 8 月 18 日,韶音在上海举办媒体沟通会,正式发布开放式耳机新品 OpenFit 2 AI。而光帆科技作为韶音重要的技术合作伙伴,为本款产品提供了 AI 技术支撑。 沟通会上,韶音宣布与光帆科技达成 AI 技术合作,将在 OpenFit 2 AI 中上线基于光帆自研 AI OS 的效率功能合集 ——“AI 实验室”,为智能对话、日程待办、快记快查、智能消息等创新类 AI 能力提供技术支撑,助力韶音为强沟通人群打造更高效的 AI 耳机体验。值得关注的是,这是光帆 AI 技术能力首次正式落地第三方头部硬件品牌,标志着其系统化 AI 能力已从自有产品验证,进阶为可向行业伙伴输出。 基于光帆自研 AI OS 的效率功能合集——“AI 实验室”,即将在韶音 OpenFit 2 AI 耳机上线。 目前 AI 硬件正加速进入端侧规模化落地阶段。据 The Business Research Company 预测,2026 年全球 AI 耳机市场规模将达到 74.2 亿美元,2030 年有望增长至 173.4 亿美元。 在中国市场,开放式耳机是增长最快的细分品类之一,IDC 数据显示,…
在量子电动力学世界中,真空并非空无一物,而是伴随虚粒子的不断产生与湮灭。然而自由空间中的真空涨落通常较弱,难以对宏观凝聚态体系产生可观测影响。如何将其转化为调控量子物态的资源,是凝聚态物理与腔量子电动力学交叉领域的重要课题。研究团队探索利用真空涨落,实现对宏观量子物态的可控调节。研究团队为此引入太赫兹分裂环谐振器构成的“暗腔”,通过重塑电磁环境显著增强真空涨落。研究团队将超导体二硒化铌嵌入暗腔,发现暗腔中二硒化铌的超导临界温度获得实质性提高。在六层二硒化铌器件中临界温度最高提升 5.4%。同时,超导体的临界电流和临界磁场在超导转变附近也显著增强。这是国际上首次实验观测到真空涨落增强超导。
“异地出差深夜发烧,人生地不熟怎么办?”“小县城的深夜,生病用药除了跑医院急诊还能找谁?”这些困扰千家万户的深夜健康难题,正被美团买药“小黄灯民生服务计划”织就的健康服务网络逐步破解。 美团医药健康数据显示,“小黄灯民生服务计划”推出五年来,平台24小时药店已增至16000家,累计服务近2亿用户。从社区居民深夜急需用药,到异地出差、旅行途中的临时购药,24小时药店服务正覆盖更多夜间健康场景。 夜间健康服务的供给与需求之间,曾存在着巨大的不平衡。艾媒咨询《2020夜间用药行业研究报告》显示,近九成受访者一年内有过夜间生病或家人需用药的经历,但其中超过六成的人选择忍耐,核心原因正是买药不便以及不知道哪里有24小时药店。对线下药店而言,24小时营业意味着高昂的人工、水电和安保成本,加上夜间客流的不确定性,难以形成商业闭环。 美团医药健康相关负责人回忆,在发起“小黄灯”计划之初,行业内24小时药店仅有2000多家。“善意可以让一家药店守一晚,只有效率能让一万六千家药店每晚都亮着灯。”要彻底解决夜间买药难题,不能完全依赖补贴和公益,而是要重构成本结构。近五年,美团医药健康持续迭代24小时药店运营…
根据发表在 PNAS 期刊上的一项研究,X 算法会向民主党用户推送更多激发愤怒(ragebait)的信息流。论文合作者、斯坦福大学博士后研究员 Ziv Epstein 说,和其它社媒网站类似,X 信息流算法的优化目标是提升用户参与度,但并非所有类型的参与度都一视同仁。X 的算法会向用户推送与其价值观相冲突的内容,尤其是当他们回复那些令其愤怒或挑衅的帖子时。尽管回复仅占互动的 6.8%,但它们承载了不成比例的权重:“这是一个愤怒诱饵(ragebait)的反馈循环。算法学会你会被激怒,然后继续为你推送更多此类内容。”目前不清楚为什么 X 更频繁向民主党用户而不是共和党用户推送激发愤怒的内容。这可能是因为 X 上右翼内容总体上更多,或者民主党用户更倾向于与其不认同的帖子互动。
8月18日,中国人工智能产业发展联盟第十八次全体会议上,中国信息通信研究院联合淘宝闪购正式发布《即时零售智能体可信基本要求》。这是即时零售领域首份针对AI Agent的系统性可信规范,标志着即时零售智能体应用迈入“有规可依”的新阶段。 该规范由中国人工智能产业发展联盟安全治理委员会发起,中国信通院与淘宝闪购牵头起草,蚂蚁、百度、阶跃星辰、MiniMax、同盾等企业共同参编。 中国信通院人工智能研究所安全治理部工程师郭苏敏介绍,在技术框架上,《即时零售智能体可信基本要求》围绕功能完备性、执行准确性、执行效率性三大能力维度,以及数据安全、访问安全、运行安全、漏洞管理、服务管理、科技伦理六大领域,构建覆盖智能体全生命周期的可信评估体系。规范明确,简单任务执行准确率应超过95%,复杂任务超过90%,接口成功率超过99%,评测须分别构建不少于100道测试题。“该技术规范填补行业可信评估空白,为人工智能技术在即时零售领域应用筑牢安全底线。” 淘宝闪购AI工程技术相关负责人刘广峰表示:“即时零售场景下,智能体面对的是高约束、多意图、实时变化的用户需求,行业亟需一套可量化、可复现的评测基准。基于即时零…
“把这几个字改下,其它的什么都别动。”——这个需求看似简单,实则很难完成,因为经常会出现文字抠不出来、找不到字体,背景有修改痕迹等等问题,即使是专业设计师,也很难做到“看不出来改过”。 目前,基于扩散模型的图像修复实现了“无需分层文件,即可修改文字”,但文字修改只要有一点瑕疵,就容易暴露破绽,所以如何实现真正的“无痕”改字有很高的难度。 当前主流的两个方法分别是“依赖图像修补”和“依赖OCR或固定字表”的建模方式,但前者容易丢失原始文本区域关键信息,导致字体细节和风格一致性下降;后者则容易限制模型在多语言和开放词汇场景下的泛化能力。 对此,美图影像研究院(MT Lab)提出了一种面向开放词汇的自提示(Self-Prompting)场景文本编辑方案,通过直接从输入图像中提取风格信息,并结合目标文本生成高保真的字形提示,将二者与原图进行统一建模,从而实现无需额外编码器的端到端编辑。该成果近期已被机器学习领域三大顶级会议之一的ICML 2026录用。 论文链接:https://arxiv.org/abs/2605.15523项目主页:https://hongxiii.github.io/ms…
作者:vivo 肖博 AI 合作者:ChatGPT(GPT-5.5) 创作模式:Human-led, AI-collaborated 责任声明:文章观点、理论体系及最终内容由作者负责;AI 参与讨论、推演、表达优化及部分内容生成。 研究说明:知识驱动计算(Knowledge-driven Computing, KDC)是我们正在提出和持续打磨的一套 AI 应用软件工程理论,目前仍处于开放研究阶段。前三篇分别讨论了领域现实、知识边界以及从推理到受治理行动的链路。这一篇讨论长期运行问题:一次正确行动结束后,什么历史应该影响未来,又如何避免系统把偶然经验和错误反馈不断放大?本文摘要:记忆的价值不在于保存更多历史,而在于决定哪些历史仍然可以影响未来的判断与行动。本文把记忆放入形成、强化、衰减、冲突、遗忘、迁移和归档的生命周期,并进一步说明反馈验证与错误归因如何帮助系统修正知识、记忆、推理和治理策略。KDC系列文章:《软件从现实开始:知识驱动计算(KDC)的 Reality First 主张》"《软件不是文件:KDC 的知识工程主张》"《调用成功不等于判断正确:KDC 的行动治理主张》"《保存历…
With a fixed deadline and design resources committed elsewhere, Stampli used Codex and ChatGPT Work to compress weeks of launch production into days.
The idea behind OpenAI's Trusted Access for Cyber program is to give trusted defenders better models so they can report bugs and vulnerabilities to companies, with the aim of getting flaws patched faster.
The Visual Intelligence Summit (October 22) is a gathering in San Francisco for the people building AI that sees and acts in the physical world.

当一只老鼠闯入上海动物园白颊长臂猿馆时,猴子没有试图吃掉它,或者驱赶它。一只雌性长臂猿迅速抓起了它,温柔地捧着它,抚摸着它。看到这一幕的牛津大学演化生物学家 Cyril Grueter 感到十分困惑。他随后与一个国际团队合作,发现了更多灵长类动物与其它物种亲密互动的例子。一只年轻雄性倭黑猩猩小心翼翼地抱着一只獴崽。一些猴子爬到猪背上;另一些猴子骑在鹿背上。一只灰叶猴抚摸着一只松鼠。一群短尾猕猴一起为一只流浪狗梳毛。研究团队共收集了 427 个案例,数据来源包括科学论文、媒体报道以及一项针对 37 位灵长类动物学家的全球调查。互动多数涉及玩耍或梳毛,发生在野外和圈养环境中。涉及的物种包括 88 种灵长类动物和 127 种其它物种。不是所有的动物互动记录是友好的,有 26 起事件被认定是虐待。研究发现,灵长类动物与其它物种的互动模式与其年龄和性别有关。幼年灵长类动物更倾向于玩耍,雌性灵长类动物则更倾向于梳毛。大多数互动都由灵长类动物主动发起。研究结果表明,饲养宠物的行为不是突然出现在人类身上的,而是源远流长。
一个尚未发布的模型,已经具备接近“关键级”的网络攻击能力,另外一边,已经有一个内部模型则在安全测试中逃出沙箱、利用零日漏洞入侵了 Hugging Face。面对能力增长超出安全设施承载范围,OpenAI暂停了部分强化学习训练。 2026年8月18日,OpenAI 罕见地公开承认:为了升级安全、监控和对齐体系,公司曾暂停最新一代模型的强化学习训练两周。 Altman 在 x 发文称,暂停了一些前沿强化学习训练,以确保能够满足针对当前模型新能力水平所需的对齐、安全和监控标准。模型进展目前非常迅速,OpenAI 一直强调,如果认为模型存在问题,将采取行动。 截至公告发布时,规模最大的前沿强化学习训练仍未恢复。 之所以这么做,原因很简单——一个即将推出的模型(官方披露的模型代号是“Astra”)可能已达到“关键级”网络安全能力,而现有研究基础设施、监控和对齐措施尚不足以完全覆盖相应风险。 但是,这并不意味着模型的全部训练已经停止。小规模训练、能力评估和安全验证仍在进行。 导火索是一次真实入侵 OpenAI踩下刹车,并不是出于某种抽象的未来担忧,导火索是一场已经发生的网络安全事件。 2026年7…
面对大模型规模与硬件内存之间高达20倍的算力鸿沟,不重训的“1比特量化”如何把千亿参数的硅基大脑塞进微型设备? 编辑丨岑峰 在 AGI 的狂飙之路上,大语言模型(LLM)正以一种近乎野蛮的“规模法则(Scaling Law)”吞噬着算力与数据。然而,当这些拥有千百亿参数的硅基大脑试图从云端降临到手机、汽车甚至植入式医疗设备时,却撞上了一堵难以逾越的“内存墙”:过去几年,模型参数规模的暴涨速度,惊人地达到了底层硬件内存容量增长速度的 20 倍。 在刚刚于德国不莱梅开幕的 IJCAI 2026 大会上,AI科技评论注意到,学术界与工业界正在达成共识:寄希望于摩尔定律或下一代芯片的发布来填平这 20 倍的算力鸿沟,已是痴人说梦。唯一的出路,是向模型的数据表示方式“动刀”。 来自苏黎世联邦理工学院Center for Project-Based Learning 的博士后、即将履新香港理工大学的秦浩桐,在首日的“Generalizing from Limited Resources in the Open World”主题 Workshop 中,给出了一个创新解法:挑战无需重新训练的“后训练量…
童年时期创伤经历可能会导致成年后缺乏动力,从奖赏中获得的快乐减少——即快感缺失(anhedonia)。人类的童年创伤与大脑奖赏相关通路活动的改变有关,这些通路来自海马体区域。动物临床前研究表明,海马体的改变可能会导致快感缺失。但与童年创伤相关的海马体改变是否会使人更容易发展出快感缺失呢?研究人员让一群参与者填写了童年创伤和体验快乐能力的问卷,然后使用 fMRI 检查海马体与动机相关脑区的相互作用。结果发现,童年时期经历过创伤且海马体通路受损的人,比童年创伤但海马体通路未受损的人表现出更多的快感缺失。