# 美团开源LongCat-2.0:国产算力上训出1.6万亿参数大模型,多项基准追平Claude
2026年7月6日,美团正式开源万亿参数大模型LongCat-2.0,同步开放针对国产算力芯片深度优化的推理代码。这是业界首个在五万卡国产算力集群上完成全流程训练与推理的万亿参数模型,标志着国产AI基础设施在大模型赛道上的关键突破。
核心参数一览
| 指标 | 数值 |
|---|---|
| 总参数量 | 1.6万亿 |
| 平均激活参数 | 约480亿 |
| 架构 | MoE(混合专家) |
| 最大上下文 | 100万token |
| 训练集群 | 五万卡国产算力 |
| 开源协议 | 开放推理代码 |
实测性能:多项基准追平顶尖闭源模型
LongCat-2.0并非"为开源而开源"的象征性产品。从官方公布的基准测试来看,该模型在多个关键维度上展现了与GPT-5.5、Claude Opus 4.6等顶尖闭源模型正面竞争的实力:
| 评测基准 | LongCat-2.0 | GPT-5.5 | Claude Opus 4.6 | Gemini 3.1 Pro |
|---|---|---|---|---|
| SWE-bench Pro | 59.5 | 58.6 | 57.3 | 54.2 |
| SWE-bench Multilingual | 77.3 | — | 77.8 | — |
| Terminal-Bench 2.1 | 70.8 | — | — | — |
| RWSearch | 78.8 | — | — | — |
| FORTE | 73.2 | — | — | — |
| BrowseComp | 79.9 | — | — | — |
在软件工程基准SWE-bench Pro上,LongCat-2.0以59.5分领先GPT-5.5(58.6)和Claude Opus 4.6(57.3)。在多语言编程基准SWE-bench Multilingual上得分77.3,与Claude Opus 4.6的77.8基本持平。
值得注意的是,LongCat-2.0在搜索智能体评测RWSearch(78.8)和生产力场景评测FORTE(73.2)上也表现出色,说明模型不仅在代码能力上突出,在真实场景任务中同样具备实用价值。
技术亮点:MoE架构+100万token超长上下文
LongCat-2.0采用MoE(混合专家)架构。MoE的核心思路是将模型拆分为多个"专家"子网络,每次推理只激活其中一部分,从而在保持总参数规模的同时大幅降低推理成本。LongCat-2.0平均每次推理仅激活约480亿参数,约为总参数的3%。
原生支持100万token的超长上下文输入,意味着可以一次性处理整本长篇小说、完整代码仓库或大型技术文档,非常适合代码理解、长文档分析等场景。
国产算力的里程碑意义
LongCat-2.0最值得关注的价值,在于验证了一条关键路径:国产算力集群完全可以支撑万亿参数大模型的完整训推流程。
过去业界普遍认为万亿参数模型的训练高度依赖英伟达H100/B200等顶级GPU集群。美团此举证明,通过算法和工程优化,存量国产芯片同样可以跑出与国际顶尖水平比肩的模型能力。这对于受限于算力供给的国内AI产业而言,具有战略级别的示范效应。
模型已在GitHub开源,开发者可直接获取推理代码进行部署测试。随着国产算力生态的持续成熟,万亿参数大模型的平民化正在加速到来。