具身智能观察

DeepSeek V4 多模态开源,我们把它的视觉链路拆了一遍

产业动态

来源:雷峰网发布时间待核实

图片不只被编码,还直接参与 Attention、MoE 与 Agent 推理。 作者丨郑佳美 编辑丨岑 峰 这不是一个全新的模型突然出现。早在 8 月 21 日,DeepSeek 就已经把它接入 API,当时外界只能看到结果:V4 开始能处理图片,而且在 ApexBench、Agents' Last Exam、Chartography 等多模态 Agent 基准上整体提升。 现在不一样了。 随着权重和参考推理代码公开,V4 的视觉部分第一次可以直接拆开看。Vision Encoder 怎么处理图片,Aligner 怎么把视觉特征压进语言空间,视觉 Token 怎么进入 DFlash,MoE 又怎么给图片选择专家,这些东西都已经暴露出来。 拆完代码会发现,DeepSeek 做的并不是简单给 V4 接一个看图模块。 图片经过视觉编码以后,会被直接塞进 V4 原有的 Token 序列,继续参与长上下文 Attention、MoE 路由和后面的 Agent 推理。甚至连注意力窗口和专家路由,都专门为视觉 Token 改了规则。 所以这次开放权重之后,更值得研究的问题已经从 V4 会不会看图,变…