Insider Brief Nvidia has introduced Jetson Orin Nano 2, a compact robotics computer aimed at entry-level edge AI applications including robots, delivery and inspection drones, and machine-vision systems. According to Nvidia, the new module delivers twice the inference performance of the previous Jetson Orin Nano Super while retaining the same form factor. At equivalent performance, […]

大模型推理成本已成为AI产业落地的核心瓶颈。随着模型参数规模向万亿级迈进、多模态智能体应用场景爆发,推理引擎需要应对算子实现、内存管理、量化压缩、异构调度与并行策略等多维度的技术挑战。本文整理自清华大学助理研究员金煜阳博士在 QCon 全球软件开发大会 2026 北京站的分享《大模型推理加速全链路:内存管理、编译优化、量化与并行策略》。 金煜阳系统介绍了其所在实验室在大模型推理加速全链路方面的探索,覆盖从底层算子优化到上层并行策略的完整技术栈。本文将逐一展开算子级性能调优中的细粒度图层优化方法、面向异构模型结构的KV Cache内存管理、编译与运行时协同的混合精度量化、基于负载特性的CPU-GPU异构调度,以及面向动态请求场景的自适应并行策略,最后介绍开源推理引擎赤兔在国产芯片生态中的实践成果。 以下是演讲实录(经 InfoQ 进行不改变原意的编辑整理)。 背景与挑战 人工智能的市场规模正在以超出预期的速度扩张。去年来自Precedence Research和艾瑞咨询的数据预测,到2030年全球AI市场规模将达到11万亿。但今年年初OpenAI的持续爆发,以及智能体应用的集中涌现,让这…

截至 2026 年 6 月,我国日均词元调用量已突破 500 万亿,中国大模型在全球竞争中位居第一梯队。当前旗舰模型几乎以月为单位更新,竞争焦点转向智能体落地与生态建设,推理算力需求随之爆发。腾讯混元 3 正式版上线第一周,Token 调用量比上一代混元 2 增长 68 倍。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtbbhr1c0r0jroamimh5nql2
智谱 GLM-5.3-Flash 上线即成新标杆:321B 参数、全新架构,靠 10 万+ 张国产芯片跑出 OpenRouter 历史 4 倍的 token 消耗纪录并限时半价。能力越级、价格脚斩的背后,是混合注意力重写与 IndexPool 池化带来的成本重构。 这几天 ox-alpha 用爽了吧… 正如很多人猜的那样,这个模型来自智谱,正式名称为 glm-5.3-flash,支持多模态,但很多人没猜到的是:这个乱杀的模型只有 321B,且与 glm-5.3 不同,是完全的新架构 更尼玛离谱:智谱的这段时间模型给全世界畅跑,完全是用国产卡供的!!其支撑起的单日 token 消耗量,创下了 OpenRouter 平台历史纪录的 4 倍,而这一切的背后,是 10万+ 张国产芯片集群的服务 还有就是:这模型比 ds4p 聪明,比 ds4f 便宜,还开源,至此…大模型行业又多了一条斩杀线 你以为这就完了?不不不…这个模型开启了限时折扣,半价,所以…真实的斩杀线在这里….斩杀这个词,现在具像化了 对此…只能说唐老师的信用分还是太稳定了:牛来,就是给啊哞的情书 能力越级,价格脚斩 对于这个模型,…


Nvidia is buying open-source AI platform Hugging Face for $12.9 billion, about 80 times its $150 million annual revenue. The deal fits Nvidia's push to invest billions in open AI models while closed providers like OpenAI and Anthropic move away from Nvidia hardware. The article Nvidia snaps up Hugging Face for $12.9 billion as closed AI labs pull away appeared first on The Decoder.

作者|Wildcard 编辑|靖宇 129 亿美元,英伟达要把 Hugging Face 买下来了。 当地时间 8 月 26 日外媒率先爆出消息, 两天前还只是 Hugging Face「正在探索出售」的新闻,转眼就变成了「双方已达成协议」。速度快得让人来不及消化。 这不是一笔普通的 AI 公司并购,而是芯片之王第一次伸手去抓开源 AI 世界的「分发权」。 Hugging Face 被称为 AI 界的「GitHub」,托管着超过 300 万个模型仓库,服务 1300 万开发者,Meta 的 Llama、阿里的 Qwen、Mistral 的开源模型,全都住在这个平台上。它是整个开源 AI 生态事实上的「默认分发层」。 而英伟达,已经垄断了训练和推理的 GPU 硬件。 现在,它还想拥有模型流通的那条路。 01踩着 AI 打滚 先说钱。Hugging Face 上一轮融资是 2023 年 8 月的 D 轮,Salesforce 领投 2.35 亿美元,估值 45 亿美元。Google、英伟达、亚马逊、IBM、Intel、AMD、高通全都参投了那一轮。三年后,129 亿美元的价格大约是上一轮估…
Nvidia has reportedly agreed to buy Hugging Face, the popular open-source AI hub, for $12.9 billion in a move that would let Nvidia both protect its chip empire and jump back into the cloud business.
线下实体网点正经历一场静默的效率困局。一方面,人力成本刚性攀升,单厅月均运维成本达8至15万元;另一方面,客流波谷时段的人力空转与高频重复咨询造成的隐性浪费,每年可达20至40万元。越来越多网点管理者开始关注AI数字员工这一方案,但受限于云端方案的网络依赖与数据合规风险,以及整机设备较高的场地改造成本,规模化落地始终存在阻力。 近日,中科通量(SMARCO)在移动整机版OmniMate的基础上,推出OmniMate BOX轻量版AI数字员工,通过即插即用的方式将存量屏幕智能化。该产品采用“边缘智算主机+音视频外设+存量显示终端”的分体式架构,旨在以轻量化方式降低线下网点引入AI数字劳动力的门槛,在不依赖外网、不改动场地的条件下实现快速部署。 分体式架构:复用现有终端,降低准入门槛 与市面上主流的一体式数字人终端不同,OmniMate BOX将算力单元与外设、显示设备解耦。整套系统由一台小型智算主机、摄像头及麦克风扬声器组成,通过HDMI接口直连网点已有的电视、广告机、会议屏或触控屏,无需采购专用显示设备或进行场地改造。 该产品的定位非常清晰:面向已具备显示终端但缺乏AI交互能力的存量网…

Ox Alpha = GLM-5.3 Flash AA = 57,以1/100的前沿价格, 由纯国产芯片驱动。在OpenRouter上实现了近20%的周token份额(第一)。 感谢大家的支持。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtb43lik0i9sroamwtuxb1bu
The Information 报道,英伟达同意以 129 亿美元收购 Hugging Face。这笔交易仍处于敲定阶段,仍有可能告吹。英伟达是 Hugging Face 的投资者,它在 2023 年参与了 Hugging Face 的 D 轮融资,当时以 45 亿美元估值融资 2.35 亿美元。英伟达去年还提议以 70 亿美元估值投资 5 亿美元,但遭到 Hugging Face 的拒绝。Hugging Face 是开源 AI 生态系统的核心,托管着数百万个可供开发者使用的 AI 模型和数据集。收购该平台有助于让英伟达在 AI 开发者中占据更大的市场份额。
Zhipu AI revealed its anonymous Ox Alpha model is the new GLM-5.3-Flash, running entirely on a cluster of over 100,000 domestic chips at Nvidia-comparable efficiency.
AI视频创作看似热闹,实则暗藏隐忧。耗时耗力、竞争激烈、变现困难,创作者沦为平台的免费劳工。本文犀利剖析AI内容赛道的商业逻辑,指出只有平台和工具商获利,普通创作者难逃被收割的命运,引发对行业生态的深刻反思。 做了几条AI视频内容以后,并不看好这个赛道。 一是费时费力又费钱。主要是太熬人了,一个人得集编剧、导演、美术、服装等等为一体,这些工种都有各自门道,想做好不容易的,都需要时间成本。时间才是最贵的。 二是竞争人数太多。技术平权是所有人都可以参与,也就意味着没有任何进入壁垒,几亿闲人都可以干,注意力也就那么点,无非是让信息大爆炸更爆炸了一点。 三是缺乏好的商业模式。所以行业和内容的根本问题都是谁来消费,消费不是使用,消费是要花钱的。现在所有网络大神做的内容并没有付费入口,也没有付费场景,都是在为平台发光发热。 平台是大地主,所以自媒体创业者,品牌方,内容作者,都是给平台打工。最残酷的地方是,以前拉长工,地主至少是给钱给粮的,现在拉长工,是要给地主付费的,算力费用可不低。 地主只做一件事,就是找优秀的长工,树立标杆和典型,让更多迷茫的人一起学习ai创作,消费token。 所以整个链路下…
智谱正式发布并开源 GLM-5.3-Flash,Ox Alpha「牛来」 身份揭晓 8 月 26 日,智谱正式上线并开源 GLM-5.3-Flash(320B-A18B),这是 GLM-5 系列的首个原生多模态模型,也正是上周以来匿名登顶 OpenRouter、被社区称为 "牛来" 的 Ox Alpha 的正式身份。 该模型总参数 320B、激活 18B,在权威的 Artificial Analysis 综合智能指数中取得 57 分、与 Claude Opus 4.8 持平,编程表现亦与 Opus 4.8 相当;定价仅为 GLM-5.3 的 1/10(限时折扣内约为 Opus 4.8 的 1/40)。模型以 MIT 许可证开源,权重已上线 Hugging Face,官方确认其完全运行在中国 AI 芯片上。(来源:IT 之家) OpenAI 发布 Hugging Face 安全事件官方报告,还原 AI 模型沙箱逃逸全过程 8 月 27 日,OpenAI 发布了关于 Hugging Face 遭入侵事件的官方报告,首次较为完整地还原了这起事件的经过:一系列罕见因素叠加,导致一款 AI 模型…
要闻提示 1.9月1日卸任!苹果为库克举办告别派对,罕见公开同性伴侣 2.没想到!DeepSeek前7个月营收达去年10倍,竟还亏损超7亿 3.突传裁员30%、降薪过万、校招劝退?中国电信、天翼云员工称「断崖式」收缩 4.腾讯高管回应“腾讯做AI慢了”质疑:熬得久,比起得早更重要 5.经济学家付鹏:宇树研发经费,比牧原养猪的研发经费还低 6.变相降薪?顺丰回应将15%月薪划为季度绩效:非降薪,旨在完善员工激励机制 7.长鑫存储、长江存储无意向苹果大量供应芯片,主要供应国内客户 8.Anthropic发布论文预警,智能体悄悄聊天就能传播病毒 今日头条 9月1日卸任!苹果为库克举办告别派对,罕见公开同性伴侣 8月26日消息,近日,苹果在Apple Park总部为库克举办告别派对,约200名内部员工出席。仪式上,库克在致辞中首次公开提及并感谢了自己的同性伴侣,并直呼其名迈克(Mike),让在场员工感到十分意外。一直以来,库克对私生活极为低调。仅2014年公开宣布出柜并表示自豪外,他几乎从未在公开场合谈及个人感情。 不过,此次派对Mike并未现身,现场流出的照片中仅有一张库克手持吉他与乐队成员…
英伟达预计 2028 财年销售额同比增长约 70%,CEO 黄仁勋称实际市场需求远高于这一数字,增速主要受供应能力限制。公司同时宣布将在 2027 至 2028 年向 AWS 额外供应 200 万块 GPU。第二季度营收同比增长 106% 至 962.2 亿美元,连续第 13 个季度创下营收纪录。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtas790607swroamcmunq53y
Anthropic 的每兆瓦收入从 2024 年的负毛利(每 1 美元收入对应 1.94 美元算力成本)扭转为 2026 年 40-50% 的毛利率,并在 2026 年首次实现盈利季度:109 亿美元营收、5.59 亿美元营业利润。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtggvk4m0cgtroj79fv55h7o
亚马逊与英伟达宣布扩大合作,将在2027和2028年为AWS数据中心新增200万颗GPU芯片,包括Blackwell Ultra、Rubin和Rubin Ultra。此前五个月亚马逊刚同意部署超100万颗英伟达GPU,英伟达称此后"需求超出预期"。双方未披露财务条款,但按GPU单价估算交易价值达数百亿美元。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtar8e770746roam1wznm4mi
Amazon is adding another 2 million Nvidia GPU chips to its data centers over the next two years. But this extended partnerships stretches beyond buying more chips.
AI factories must support increasingly large models and more complex reasoning workloads. To keep up with the insatiable compute demands of AI workloads,... AI factories must support increasingly large models and more complex reasoning workloads. To keep up with the insatiable compute demands of AI workloads, hyperscalers and AI-native companies are developing custom AI accelerators, or XPUs. Deploying these accelerators at scale requires high-bandwidth memory (HBM) to keep compute fed, sufficie…
The next wave of AI is placing new demands on infrastructure. As AI agents and trillion-parameter workloads become mainstream, the performance of AI infrastructure depends not only on compute, but on how compute, memory, storage, networking and software are designed together as a unified system. To help hyperscalers and AI innovators build the next generation […]
Amazon Web Services (AWS), an Amazon.com, Inc. company (NASDAQ: AMZN), and NVIDIA (NASDAQ: NVDA) today announced a major expansion of their strategic collaboration to meet surging global demand for AI infrastructure as demand continues to accelerate.