全程公开“直播”训练!斯坦福535B大模型打破AI闭源壁垒,吴恩达力挺
日期:2026-08-28 12:14:05 / 人气:31

当下全球大模型行业陷入微妙僵局,多数厂商纠结于是否开放模型权重,训练数据、核心代码、调试过程等关键技术更是被视作核心机密、严格保密。在此背景下,斯坦福大学基础模型研究中心(CRFM)牵头启动的Marin项目走出了一条截然不同的道路:正式开启5350亿参数Marin 535B-A23B大模型的公开训练,为期三个月的训练全程透明,训练曲线、数据配方、模型配置、技术讨论乃至失败尝试全部实时公开,彻底颠覆了大模型训练的“黑箱模式”,更获得AI泰斗吴恩达公开点赞支持。
项目核心概况:千亿级MoE模型公开实训
该项目由斯坦福计算机科学副教授、CRFM主任Percy Liang主导,团队汇聚了斯坦福大学、Open Athena及AI开放社区的多名研究人员。Percy Liang深耕AI领域,曾担任微软收购的Semantic Machines首席科学家,也是知名开源AI企业Together AI联合创始人,拥有丰富的大模型研发与产业化经验。Marin项目最早于2025年5月对外公布,此前已完成8B、32B小规模模型训练,此次正式将训练规模拓展至535B超大规模层级。
根据公开训练计划,Marin 535B-A23B完整训练周期约3个月,依托11套NVIDIA GB200 NVL72系统运行,总计算量达2.7×10²⁴ FLOPs。训练将处理18.75万亿Token数据,其中80%用于预训练、20%用于中期训练,完成主体训练后还将开展后置优化训练。该模型为混合专家(MoE)架构,参数设计采用“总参数大、激活参数精”的差异化逻辑:整体总参数5350亿,但单Token计算仅激活230亿参数,通过路由模块动态分配计算资源,既扩大了模型整体容量,又避免了稠密大模型计算成本随参数同步暴涨的弊端。
值得注意的是,230亿激活参数无法等同于23B稠密模型。该模型采用“共享专家+路由专家”双结构设计,每层固定保留2个共享专家、动态激活8个路由专家,两类专家均采用半宽结构,路由专家额外叠加2倍压缩策略。其中共享专家持续参与计算,贡献约三分之一的专家算力,核心目的是缓解MoE模型训练中普遍存在的Token丢弃问题,保障训练稳定性。
行业突破:不止开源权重,打造AI“开放实验室”机制
当前行业内Llama、Gemma等开源模型,仅对外开放模型权重,核心的训练代码、数据配方完全保密;BLOOM、Pythia、OLMo等项目虽进一步开放了部分训练日志、数据与代码,但仍未形成标准化的公开协作体系。传统大模型研发如同封闭实验室,外界只能看到最终成型的模型与技术报告,无法知晓研发过程中的决策逻辑、调试过程与失败案例,严重制约了行业整体技术迭代。
Marin项目的核心创新,是将单次模型开源升级为常态化的开放实验室协作机制,真正对标开源软件的协作模式。项目所有实验均通过GitHub Issue提前公示研究目标与核心假设,模型配置、训练代码通过Pull Request迭代更新,全球科研人员均可参与代码审核与技术讨论;训练启动后,W&B平台实时同步Loss等核心训练指标,从实验立项、参数调试、迭代优化到训练失败、方案调整的全部痕迹,全程完整留存、公开可查。
这种极致的开放性获得了行业高度认可。吴恩达公开转发力挺,将Marin项目定义为“捍卫AI开放性的珍贵示范”,感慨公开发布AI研究成果本是行业常态,高度认可该项目全链路公开的研发理念。Percy Liang团队也明确表示,项目核心目标并非单纯打造一款高性能大模型,而是探索核心命题:在算力垄断、技术封闭的行业趋势下,基础模型能否实现开源化、社区共建化发展。该项目相关动态在X平台浏览量突破80万,引发全球AI领域广泛关注。
技术攻坚:破解MoE模型训练核心难题
MoE架构虽是当下大模型扩容的主流路线,但存在显著的工程短板,训练瓶颈并非单纯的GPU算力,而是跨设备通信、专家负载均衡与内存调度问题。不同Token会被路由至不同GPU、不同机架的专家模块,前后需要两次全量互通传输数据,极易出现“热点专家”——部分专家负载过载、部分专家闲置,为避免显存溢出设置的Token丢弃机制,又会大幅削弱训练效果。
Marin团队在实践中发现,上下文长度会直接影响Token丢弃率:当上下文从4K拓展至65K时,Token丢弃比例会从7%骤升至40%。为此,团队放弃了超长上下文启动训练的常规思路,选择以4K上下文开启预训练,同等Token批次下可容纳翻倍的独立序列,大幅优化专家负载均衡。同时,团队自研pooled/wave专家并行方案,成功将4K上下文下的Token丢弃率压缩至3%。
在训练技术栈层面,该模型基于JAX、XLA与Levanter框架搭建,为适配NVIDIA GB200 NVL72硬件集群,团队针对性完成大量技术优化。由于现有开源方案无法满足JAX/XLA GPU环境下的专家并行性能需求,团队手动实现专属专家并行(EP)方案,依托GB200 NVL72机架级NVLink高速通信能力,实现跨卡通信与专家计算的高效重叠,最大化释放MoE模型训练效率。此外,项目建立了完善的风险应对机制,针对硬件故障、算力利用率下降、训练滞后等问题预设调整方案,可灵活优化训练Token量、学习率与数据配比,避免机械执行原计划导致的训练失效。
创新研发体系:“缩放梯”筑牢大规模训练底座
为规避千亿级模型训练的未知风险,Marin团队独创“缩放梯(Scaling Ladder)”迭代机制,未直接投入全量算力训练535B模型,而是先完成多档小规模MoE模型训练,覆盖1.6B(61M激活参数)至27.7B(1.2B激活参数)多层级模型,仅耗费总计算量1%的算力,却实现了多重关键价值。
首先,缩放梯可精准预测535B模型各阶段合理损失区间,一旦主训练曲线偏离阈值,可快速定位数据、路由、优化器等环节的问题,避免万亿Token训练后才发现核心缺陷。其次,提前暴露并解决训练稳定性隐患,团队通过小规模模型实验发现长周期训练会引发梯度范数异常飙升问题,通过新增logit z-loss约束机制,有效抑制了数值波动风险,避免训练中途发散。最后,建立故障判别标准,区分训练过程中的正常波动与失控前兆,大幅提升超大模型训练的可控性。
不过团队也坦诚,缩放梯无法完全消除训练风险,从27.7B到535B存在近20倍参数跨度,大规模训练下仍可能出现小模型未曾暴露的通信、负载与稳定性问题,三个月的公开训练也是一场大规模MoE训练体系的实战测试。
行业定位与价值:不止模型,更是开源范式革新
需要明确的是,Marin并非全球首个直播训练的大模型项目。早在2022年,Hugging Face牵头的BLOOM 176B模型就已公开训练日志与迭代过程,后续Pythia、LLM360、OLMo等项目也持续推进训练链路开源。但Marin的突破性在于,将阶段性成果开源升级为全流程、全透明的常态化公开研发,从项目立项假设到训练失败复盘,所有研发痕迹实时公开,是目前全球超大模型规模与研发透明度结合最激进的实验。
业内人士表示,现阶段评判Marin 535B的前沿性能为时尚早。一方面,MoE模型的535B总参数无法与稠密模型直接对标,模型能力取决于专家分工有效性;另一方面,预训练损失仅能体现数据拟合效果,模型的代码、数学推理、长文本交互等核心能力,仍依赖后续数据质量优化与后训练调优。且项目仍处于训练早期,训练计划、参数配置仍存在微调空间。
相较于最终成型的模型权重,本次公开训练的核心价值在于过程资产。对于中小科研团队而言,无法复刻千亿级算力训练,但Marin公开的专家路由策略、Token丢弃优化、梯度稳定性调控、JAX-GPU适配方案等全套技术经验,具备极高的复用价值。过去开源模型解决了“谁能使用模型”的问题,而Marin正在解答“谁能知晓模型如何训练”的行业核心疑问。
无论本次三个月的训练最终圆满落地还是中途遇阻,全程公开的训练数据、故障路径与优化思路,都将为全球AI开源社区提供稀缺的超大尺度MoE训练样本,彻底推动大模型研发从“闭源垄断”走向“透明共建”,为行业规范化、开放式发展奠定重要基础。
作者:汇丰娱乐
新闻资讯 News
- 离婚7年彻底翻盘!40岁宋仲基二婚...09-08
- 冉莹颖通透处事引热议!生父重男...09-08
- 近期热度炸裂的五部热播剧盘点!...09-08
- 38岁美女演员马秋子近况曝光!曾...09-08

