美团 LongCat-2.0 开源:1.6T 参数大模型如何在五万张国产卡上跑起来
美团开源万亿参数模型 LongCat-2.0,总参数 1.6T、激活 48B,业界首个在五万卡国产算力集群上完成全流程训练推理。本文从架构创新、国产芯片适配、开源策略和后训练方案四个维度拆解这次技术突围。
2026 年 7 月,美团将万亿参数大模型 LongCat-2.0 正式开源。这不是一次普通的模型发布——它是业界首个在五万卡国产算力集群上完成全流程训练与推理的万亿参数模型。在 AI 竞争从「模型竞赛」转向「工程落地」的节点上,LongCat-2.0 给出的答案不仅是技术指标的堆砌,更是一条可复现的国产算力路径。
模型概览:1.6T 总参数,48B 激活
LongCat-2.0 采用 MoE(混合专家)架构,总参数 1.6T,平均激活约 48B,动态范围在 33B 到 56B 之间。这个设计思路很清晰:用超大容量保证知识覆盖面,用稀疏激活控制推理成本。
它的核心定位是 Agentic Coding——不是那种「你问一句我答一句」的聊天模型,而是能自主理解代码仓库、规划多步操作、执行并验证结果的编程智能体。为此,模型原生支持 100 万 token 超长上下文,足以一次性吞下整个中型代码库。
架构创新:三条技术路线并行
LongCat-2.0 在架构层面做了三项关键创新,每一项都直接服务于「在受限硬件上跑得稳」这个目标。
LongCat 稀疏注意力(LSA):超长上下文的头号难题是注意力计算的平方级复杂度。LSA 通过流感知索引、跨层索引和层级化索引三重策略,在保持模型质量的前提下大幅减少了碎片化访存和重复索引计算。简单说,它学会了「只关注该关注的」,而不是对所有 token 一视同仁。
N-gram Embedding:当 MoE 稀疏度已经推到 97% 时,继续加专家的边际收益急剧下降。LongCat-2.0 另辟蹊径,将 135B 参数投入 N-gram Embedding 模块——一种独立于 Transformer 层的参数扩展路径,占比控制在总参数 10% 以内。实测表明,这笔「投资」的回报远高于继续扩充专家数量。
ScMoE(稀疏控制 MoE):利用国产芯片的控核能力,让 Dense 分支和 MoE 分支在物理核心级别并行执行,进一步压缩端到端延迟。这是在硬件特性上做「量体裁衣」而非暴力堆算力的典型案例。
国产芯片上的工程突围
LongCat-2.0 最值得关注的不是模型本身,而是它验证了一套完整的技术路线:万亿参数模型可以在国产算力上稳定运行。
面对国产芯片显存小、带宽低、互联受限的三重约束,团队从三个层面逐层突破:
- 模型层:通过 absorb 计算模式、MLA prolog 并行处理、KVP 切分 KV-cache 等手段缓解长上下文的 I/O 和显存压力。
- 芯片适配层:用 Super Kernel 减少算子数量降低启动开销,用 Weight Prefetch 将 I/O 延迟隐藏在前序计算中。
- 部署策略层:PD(Prefill-Decode)分离部署,Prefill 端用序列并行分担长序列计算压力,Decode 端用 KV-cache 切分降低单卡显存占用。
这套方案的核心哲学是「软硬协同」——不是等硬件追上软件的需求,而是让软件适配硬件的特性。结果就是:即使用存量老卡,也能把万亿模型跑起来。
开源诚意:多精度、多平台、全链路
LongCat-2.0 的开源不是「只放权重」的敷衍。同步开源的内容包括:
- 多精度版本:BF16、FP8、INT8 全覆盖,从高端 GPU 到边缘设备都能找到合适的版本。
- 推理代码:GPU 版本已提交至 SGLang 上游(PR #30042),NPU 版本在 GitHub 单独开源。
- 模型权重:HuggingFace、GitHub、ModelScope 三平台同步上线。
这种「开箱即用」的开源策略,背后是一个明确的信号:美团希望盘活行业存量国产算力,让更多团队能在现有硬件上部署万亿级模型,而不是被迫追新卡。
后训练:多教师蒸馏与能力融合
LongCat-2.0 的后训练阶段采用多教师在线蒸馏,将专家模型分为三类:
- Agent 专家:聚焦自主执行和工具调用
- 推理专家:负责自适应推理和深度思考
- 交互专家:确保安全对齐和自然对话
最终通过 MOPD(Multi-Objective Policy Distillation)架构在国产算力集群上无缝融合,使单一模型兼具深度推理、自主执行和精准交互的综合表现。
一点观察
LongCat-2.0 的开源时间点耐人寻味。2026 年上半年,AI 行业的主流叙事正在从「谁的模型更大」转向「谁的模型能用」。AI Engineer World's Fair 上,「工程化」取代「模型竞赛」成为关键词。在这个背景下,LongCat-2.0 的价值不在于它又刷新了哪个榜单,而在于它证明了国产算力生态可以承载世界级的 AI 工作负载。
对于开发者来说,一个 48B 激活的模型能在已有硬件上部署,远比一个 600B 的模型只能膜拜来得实在。这可能就是 LongCat-2.0 最根本的竞争力。