Olmo-core 3开源训练栈升级,AI模型竞争开始转向“数据搬运效率”

摘要:: Allen Institute for AI推出Olmo-core 3,重点解决MoE模型规模扩大后出现的数据移动和通信效率问题。MoE虽然能够让超大模型只激活部分专家,从而降低单次推理和训练计算量,但专家分布、Token路由、GPU之间通信以及负载均衡都会带来新的系统开销。Olmo-core 3尝试让专家常驻GPU,并结合多种并行方式提升训练效率,同时把这些系统层面的权衡更加透明地暴露出来。AI基础模型继续扩张后,真正决定效率的已经不只是模型结构,也包括底层系统如何移动数据。
来源:: Hugging Face Blog、AI2 ([Hugging Face Blog][18])

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注