Llama3精读,FP8量化与长上下文实测,405B模型对标GPT-4

Meta 发布第三代开放权重模型 Llama 3,包含 8B、70B、405B 三个规模版本,最大 405B 在 15.6T token 上训练,性能接近 GPT-4。文章详细解析其架构特点、后训练方...

人工智能

Meta 最新发布的 Llama 3 是其第三代开放权重模型系列,包含 8B、70B 和 405B 三个规模版本,其中 405B 是目前最大的稠密 Transformer 模型之一。该模型基于 2023 年底的数据,在 15.6T token 上训练,使用了约 3.8×10²⁵ FLOPs 的算力,是 Llama 2 70B 的 50 倍。尽管模型结构(如 GQA、RoPE 基频)基本保持不变,但通过更大规模的数据集和更精细的训练策略,Llama 3 在多个基准测试中表现出与 GPT-4 相当的水平。

在技术实现上,Llama 3 引入了多项创新。首先,预训练数据从 Llama 2 的 1.8T token 增加到约 15T,且经过更严格的清洗和筛选。其次,后训练阶段放弃了传统的 PPO 方法,转而采用 6 轮"奖励模型 + 拒绝采样 + SFT + DPO"的组合,大量使用合成数据(如代码执行反馈、翻译、回译等),显著提升了模型在代码理解、多语言支持、数学推理和长上下文处理方面的能力。

为了验证模型的实际表现,研究团队进行了多项测试。在 FP8 量化实验中,Llama 3 展现了良好的性能保持能力,证明其在资源受限环境下的适用性。同时,长上下文测试显示,405B 版本能够有效处理长达 128K 的文本序列,远超前代产品。此外,Meta 还发布了系统级安全组件 Llama Guard 3,用于检测和过滤潜在的有害内容。

Scaling Law 模型性能对比

然而,尽管 Llama 3 在纯文本任务上表现出色,但在涉及物理交互的空间智能领域,大模型的表现仍有明显差距。VA-Bench 测试结果显示,即使在目标识别与定位(TL)和操作语义理解(MS)上达到 99% 以上的准确率,完整任务的成功率仍不足 60%。这表明,虽然模型能够「看懂」空间关系,但在实际执行动作时仍面临诸多挑战,如精确控制、环境感知和动态调整等。

VA-Bench 测试框架

Meta 表示,未来将继续优化 Llama 系列模型,特别是在多模态融合和具身智能方向。同时,他们也欢迎社区开发者利用 Llama 3 的开放权重进行二次开发和应用探索,推动人工智能技术的普及和发展。