535B 大模型“直播”训练三个月:代码、数据、Loss全公开,吴恩达公开力挺
产业动态
来源:InfoQ 中文发布时间待核实
当大多数模型公司还在围绕“是否开放权重”争论时,一个总参数达到5350亿的大模型,选择在训练尚未完成、甚至仍可能中途失败的时候,把训练曲线、数据配方、模型配置和技术讨论直接放到了网上。 近日,斯坦福大学计算机科学副教授、基础模型研究中心(CRFM)主任 Percy Liang 在 x 上发帖宣布,开放基础模型项目 Marin 已于上周启动 Marin 535B-A23B 的训练。 按照目前公布的计划,Marin 535B-A23B 将处理18.75万亿Token,其中约80%用于预训练,20% 用于中期训练;训练运行在 11 套NVIDIA GB200 NVL72 系统上,预计持续约3个月,总计算量约为 2.7×1024 FLOPs,之后还将进入后训练阶段。 据 Marin 项目发起公告,项目最早诞生于斯坦福大学基础模型研究中心CRFM,于2025年5月正式对外公布。发起公告的作者包括 David Hall、Percy Liang,以及来自斯坦福、Open Athena和开放社区的多位研究人员。 David Hall Percy Liang Percy Liang 曾就职于对话式 AI…