国产算力训出万亿大模型:美团LongCat-2.0的技术突围

当Kimi K3以2.8万亿参数横空出世,抢走所有媒体头条时,另一款万亿参数模型正在悄然改写国产算力的命运。

美团LongCat-2.0,总参数1.6万亿,平均激活480亿参数。这不是它的全部故事。真正让它独特的标签是:国内首个完全在国产算力集群上完成训练与推理的万亿参数模型

5万张国产算力卡,35万亿tokens训练数据,全程无回滚、无不可恢复的loss突刺。当整个行业还在讨论”国产芯片能不能训大模型”时,LongCat-2.0用事实给出了答案。

更值得关注的是,这款模型采用MIT协议完全开源,同步开放国产卡推理代码。它不只是一个技术突破,更是国产算力生态走向成熟的一个里程碑。


团队背景:一支低调的技术铁军

LongCat-2.0的成功,离不开一支低调但实力强劲的技术团队。

裴鹏,LongCat团队基础模型负责人,北京大学毕业,长期深耕信息检索与自然语言处理方向。2007年至2016年,他先后在微软中国、微软亚洲搜索技术中心与微软美国总部任职,从普通工程师成长为高级工程师。2016年加入谷歌担任搜索高级工程师。2023年加入美团后,他全面牵头美团大语言模型、多模态模型与Agent智能体模型的研发工作,主导了LongCat-2.0的技术落地。

王金刚,大模型团队技术总监。2023年起作为美团”龙猫”大模型研发负责人之一,带领团队从底层架构、自主训练框架、算法优化等全链路展开攻坚。他此前主导的生活服务知识图谱”美团大脑”,是国内最大规模的生活服务领域知识图谱。

潘欣,多模态算法负责人。曾任谷歌大脑(Google DeepMind)研究员,推动TensorFlow动态图模式开发。先后在百度、腾讯与字节跳动任职,曾主导PaddlePaddle平台优化,后任字节跳动AIGC和视觉大模型AI平台负责人。

这支团队的特点是:既有微软、谷歌等顶级科技公司的技术积累,又有国内互联网大厂的工程落地经验。更关键的是,他们从2023年就开始押注国产算力适配,三年磨一剑,最终在LongCat-2.0上实现了从零到一的突破。


一、算力卡脖子:一个绕不开的现实

2026年的AI竞赛,表面上是模型能力的比拼,底层却是算力供给的较量。

当中国AI公司需要训练万亿参数模型时,一个尴尬的现实摆在面前:最先进的训练芯片,来源有限。英伟达的A100、H100系列仍是主流选择,但供应链的不确定性,让每一次大规模训练都带有一丝风险。

这不是技术问题,而是战略问题。

如果国产算力只能做”玩具级”验证,无法支撑前沿模型的训练,那么中国AI的根基就始终建立在别人的地基上。

美团LongCat团队从2023年开始思考这个问题。他们给自己定下了一个目标:用国产算力,训出一个真正能打的万亿参数模型。

三年后,这个目标实现了。


二、从千卡到五万卡:三年磨一剑

万亿参数模型的训练,不是简单地”堆卡”。

当集群规模从千卡扩展到万卡,再到五万卡,指数级增长的不只是算力,还有问题的复杂度:硬件故障频率飙升、通信带宽成为瓶颈、显存压力逼近极限、数值稳定性难以保障。

LongCat团队从三个维度逐一攻克这些难题。

稳定性:将故障率降低70%以上

五万卡集群,每天都有卡出问题。如果每出一次故障就人工介入,训练根本跑不下去。

LongCat团队开发了自动故障恢复机制:卡间通信异常时自动隔离、弹性扩缩卡动态调整、自动重启训练任务。最终将月均日故障率降低70%以上,让训练可以”无人值守”地持续运行。

正确性:Bitwise一致性验证

国产算力芯片的软件生态不如NVIDIA成熟,算子实现可能存在细微差异。一个bit的误差,在万亿参数的规模下会被无限放大。

团队自研了确定性算子,通过Bitwise一致性验证确保每次计算结果的可靠性。同时针对关键模块提升计算精度、优化Reduce逻辑,从根源上杜绝数值漂移。

效率:训练吞吐提升1.5倍

万卡级训练的另一个挑战是效率。如果大量时间花在等待通信、调度任务上,算力就白白浪费。

团队通过流水线调度、显存优化和算子级控核,将训练MFU(Model FLOPs Utilization)提升1.5倍。最终实现稳态日吞吐超过1T tokens/day——这意味着模型每天可以”消化”超过一万亿个token的数据。

2026年6月30日,LongCat-2.0正式发布。预训练数据规模超过35万亿tokens,覆盖中文、英文、多语言和代码。全程无回滚,无不可恢复的loss突刺。

这个成绩,是国产算力平台上规模最大的训练任务。


三、三大架构创新:不只是堆参数

参数规模只是故事的开头。真正决定模型能力的,是架构设计。

LongCat-2.0围绕三个核心目标进行了架构创新:让模型看得更长、让参数更高效、让能力更全面。

3.1 LSA稀疏注意力:从平方到线性

处理100万token的长上下文,传统注意力机制的计算复杂度是O(n²)。这意味着,上下文长度增加10倍,计算量增加100倍。

LongCat-2.0引入了LongCat Sparse Attention(LSA)稀疏注意力机制,通过三项优化策略,将复杂度降至接近O(n):

流感知索引(Streaming-aware Indexing):将碎片化的内存访问转化为连续的顺序读取,利用HBM的高带宽特性,大幅提升索引效率。

跨层索引(Cross-Layer Indexing):利用相邻层注意力分布的稳定性,一次索引计算服务多层,减少重复计算。

层级化索引(Hierarchical Indexing):先通过块级近似评分进行粗召回,再在候选集中进行细粒度选择,缩小索引器需要处理的候选空间。

这三项策略协同工作,让LongCat-2.0在100万token的上下文中依然保持精准的信息定位能力——不是通过外推或插值”凑”出来的1M,而是架构层面原生支持。

3.2 N-gram Embedding:135B的隐性扩展

MoE(Mixture of Experts)架构的核心优势是稀疏激活:总参数1.6万亿,但每个token只激活约480亿参数。稀疏度高达97%。

但高稀疏度也带来一个问题:参数利用效率下降。简单扩充专家数量,收益边际递减。

LongCat-2.0的解决方案是:在MoE专家之外,引入135B参数的N-gram Embedding模块。

这个模块专门建模token间的局部组合关系。比如在代码中,ifelsereturn这些token的组合有特定的语义模式,N-gram Embedding可以更高效地捕获这些模式。

实验表明,当MoE稀疏度超过95%时,增加同等规模的N-gram Embedding参数,收益远超继续扩充专家。LongCat-2.0将N-gram Embedding占比控制在10%以内,兼顾了参数收益与结构稳定性。

更重要的是,在推理阶段,将参数从专家转移到N-gram Embedding可以降低大batch解码时的显存I/O,加速解码过程。

3.3 MOPD多专家融合:Agent、推理、交互三合一

传统MoE模型的专家是”同质化”的——所有专家做同样的事,只是参数不同。

LongCat-2.0引入了MOPD(Mixture of Purpose-Driven Experts)架构,将专家按功能分为三类:

Agent Experts:专攻工具调用与自主纠错。当模型需要调用API、执行代码、处理多步骤任务时,这类专家被激活。

Reasoning Experts:深耕数学与STEM推理。处理逻辑推导、算法分析、数学证明等需要精确计算的任务。

Interaction Experts:优化指令遵循与交互体验。让模型更准确地理解用户意图,生成符合要求的回复。

推理时,门控网络根据任务类型动态调度最擅长的专家,而非简单合并参数。这避免了”全能但平庸”的问题,让模型在特定领域也能达到顶尖水平。

后训练阶段,团队采用多教师在线蒸馏,将Agent、Reasoning、Interaction三组专家能力融合到一个模型中。最终通过MOPD架构在国产算力集群上无缝部署,实现”一个模型同时擅长写代码、做推理、懂交互”。


四、性能实测:SWE-bench超越GPT-5.5

架构创新的价值,最终要通过性能来验证。

LongCat-2.0在多个权威评测基准上取得了亮眼成绩,尤其在编程和Agent任务上表现突出。

4.1 编程能力:真实工程场景的考验

SWE-bench Pro是目前最接近真实工程场景的编程评测。它不是让你写”hello world”,而是给你一个真实的GitHub仓库和一个真实的Issue,让你理解代码、定位问题、编写修复补丁。

LongCat-2.0在SWE-bench Pro上获得59.5分,超越GPT-5.5的58.6分,领先Claude Opus 4.6的57.3分和Gemini 3.1 Pro的54.2分。

这个成绩意味着:在真实工程场景中,LongCat-2.0解决GitHub Issue的能力已经超过了GPT-5.5。

在SWE-bench Multilingual(多语言编程评测)上,LongCat-2.0获得77.3分,与Claude Opus 4.6的77.8分处于同一水位。在Terminal-Bench 2.1(真实终端指令交互评测)上获得70.8分,与Gemini 3.1 Pro持平。

4.2 Agent任务:多步骤规划与执行

Agent能力是2026年大模型竞争的核心战场。LongCat-2.0在多个Agent评测基准上表现均衡:

  • RWSearch(搜索智能体):78.8分,领先Gemini 3.1 Pro的76.3分
  • FORTE(生产力场景):73.2分,与Claude Opus 4.6持平
  • BrowseComp(网页浏览):79.9分,接近国际顶级模型水平

这些数据证明,LongCat-2.0在多步骤任务规划、复杂工具调用及长程检索执行上具有高可靠性,能够契合企业级Agent的落地需求。

4.3 实际体验:不只是刷榜

一位开发者在实测中将LongCat-2.0接入Claude Code,让它整理一个杂乱的工作文件夹。

LongCat-2.0没有上来就改文件,而是先根据目标和要求,把整理原则完整拆解出来。它分阶段处理问题:先读懂每个目录的作用,分清代码、文档、素材、测试等不同类型;再判断哪些能动、哪些不能动;最后结合测试、产品、规划、文档等不同维度进行分析,把杂乱的文件夹逐步还原成一个清晰的工作系统。

另一个测试中,LongCat-2.0被接入Codex执行Agent工作流:联网搜资料、整理大纲、调用Skill、生成演示文稿。

它先去联网搜索官方文档资料,确认模型是什么、有什么特点、适合放进什么样的内容结构里。接着检查当前环境里有哪些Skills,每个Skill能做什么,调用规则是什么。在把资料来源、工具能力和任务目标都理解清楚之后,才开始做整体规划。

从背景介绍到核心能力,从测试过程到结论,整体连贯且一致。这种”先理解、后执行”的工作模式,正是Agentic Coding的核心要求。


五、开源生态:MIT协议的真正价值

2026年7月5日,美团宣布LongCat-2.0正式开源。

这次开源不只是”开放权重”。美团采用的是MIT协议——业界最宽松的开源协议之一,企业可无限制商用,无需支付任何授权费用。

同步开源的还包括:

  • 完整模型权重:BF16、FP8、INT8多精度版本
  • 国产卡推理代码:针对国产算力芯片深度优化
  • GPU推理代码:基于SGLang框架

这意味着,即使手上没有最新算力,也能基于现有硬件将LongCat-2.0稳定跑起来。

5.1 国产卡推理代码的意义

LongCat-2.0不只是”在国产卡上训练”,更重要的是提供了完整的国产卡推理方案。

针对显存与带宽受限的国产算力芯片,美团从模型、芯片适配到部署策略三个方向进行了深度协同优化:

模型层面:通过absorb计算模式、Indexer与MLA prolog并行处理、KVP切分KV-cache,缓解超长上下文的I/O与显存压力。

芯片适配层面:通过Super Kernel减少算子数量降低启动开销,以Weight Prefetch将I/O延迟隐藏在前序计算中,基于高速片间互联完成layer-wise的KV-cache传输。

部署策略层面:采用PD分离部署兼顾TTFT与TPOT,配合异步化Expert-Parallel Load Balancing解决大EP度下的负载不均。

这套方案的开源,为国产算力生态提供了一个可复现的万亿参数模型部署范例。

5.2 已接入的主流框架

LongCat-2.0已深度适配多个主流Agent框架:

  • Claude Code:月调用量仅次于Claude Opus 4.8
  • OpenClaw:月调用量全球第三
  • Hermes:月调用量全球第一

在OpenRouter平台上,LongCat-2.0的总调用量已跻身全球前三。它以匿名身份”Owl Alpha”跑了两个月,凭借实际表现获得了开发者认可。


六、深度对比:LongCat-2.0 vs DeepSeek V4-Pro

LongCat-2.0和DeepSeek V4几乎同日发布,都采用MoE架构、支持1M上下文、参数规模相当。但两者的路径选择截然不同,堪称国产算力进化的”一体两面”。

6.1 核心参数对比

维度 LongCat-2.0 DeepSeek V4-Pro
总参数量 1.6T 1.6T
激活参数 48B(动态33B~56B) 49B
上下文窗口 1M tokens 1M tokens
架构 MoE + LSA + N-gram Embedding MoE + CSA + HCA混合注意力
训练算力 5万卡国产算力(全流程国产) 早期英伟达,后迁移国产
开源协议 MIT(完全商用友好) DeepSeek License
API定价 Token Pack模式 0.87 per 1M tokens

6.2 算力路径的分野

这是两者最根本的差异。

DeepSeek V4的早期训练基于英伟达CUDA架构和GPU硬件,之后全栈迁移至华为昇腾芯片。它适配了华为昇腾950PR推理芯片,在低精度推理中展现出超越通用GPU的效率。但这种”先英伟达、后国产”的路径,意味着它并非从零开始验证国产算力。

LongCat-2.0选择了更艰难的路:从预训练到推理,全程依托国产算力集群独立完成。它在5万张国产算力卡上完成全流程,刷新了国产算力平台上规模最大的训练任务纪录。

用一个比喻:DeepSeek是”过了算力的河”,LongCat是”弯腰造船”。前者证明了国产算力可以适配前沿模型,后者证明了国产算力可以独立支撑万亿参数的训练。

6.3 架构创新的差异

两者都针对长上下文和推理效率做了架构创新,但方向不同。

DeepSeek V4采用混合注意力架构(CSA + HCA)+ Muon优化器,在上下文长度放大8倍的前提下,算力消耗比V3.2降低七成以上。其核心思路是”极致优化现有架构”。

LongCat-2.0则引入LSA稀疏注意力、N-gram Embedding和MOPD多专家融合。LSA通过流感知索引、跨层索引、层级化索引将注意力复杂度从O(n²)降至接近O(n);N-gram Embedding在MoE之外增加135B参数建模局部组合关系;MOPD将专家按功能分为Agent、Reasoning、Interaction三类。其核心思路是”针对Agent场景重新设计架构”。

6.4 性能与场景差异

在Artificial Analysis智能指数上,DeepSeek V4-Pro(Max模式)得分52分,LongCat-2.0的分数与之接近。但两者的强项不同:

  • DeepSeek V4在通用能力、知识储备上更均衡,API定价极具竞争力(V4 Flash仅0.28),被称为”价格屠夫”
  • LongCat-2.0在编程和Agent任务上更突出(SWE-bench Pro超GPT-5.5),MOPD架构让工具调用更稳定

6.5 商业化路径

DeepSeek走的是”极致低价+生态渗透”路线。V4 Pro定价0.87 per 1M tokens,通过超低价格吸引开发者和企业。

LongCat-2.0走的是”开源生态+企业友好”路线。MIT协议完全开源,同步提供国产卡推理代码,支持Token Pack模式(30天有效期,适合高频调用场景)。对于需要私有化部署的企业,LongCat-2.0提供了更完整的技术栈。

有行业人士评价:”DeepSeek对显存、激活参数的极致压榨,死磕每个Token的计算效率,是为了给受限的硬件打补丁。LongCat则从架构层面重新设计,让模型更适合Agent场景。两条路都走通了,但LongCat的国产化深度更高。”


七、成本分析:部署一个万亿模型要花多少钱?

对于企业来说,模型能力再强,如果部署成本过高,也只能”望洋兴问”。LongCat-2.0在成本控制上做了哪些文章?

6.1 硬件需求

LongCat-2.0官方推荐的部署环境是16张H20 GPU(或同等国产算力卡)。对于没有高端多卡集群的团队,可以选择:

  • 在线Demo:直接访问 longcat.ai 体验
  • OpenRouter API调用:按量付费,快速集成
  • FP8量化方案:降低显存占用,适配中低端硬件

需要强调的是,LongCat-2.0提供了BF16、FP8、INT8多精度版本。FP8量化可以在损失极小精度的情况下,将显存占用降低约50%,让单卡80GB显存的GPU也能跑起来。

6.2 API定价模式

LongCat-2.0采用Token Pack模式,而非传统的按token计费:

场景 Token Pack方案 月成本估算
单开发者日常编码 50M token/天 $15-20
企业级多Agent团队 10-50B token/月 $1,500-5,000
混合部署(API+本地) Agent用LongCat,推理用本地LLM 视配置而定

Token Pack的核心优势是零缓存命中计费。在编码Agent场景中,模型需要反复读取、参考、修改相同的百万token代码仓库,标准架构会对重复输入收取全额费用。LongCat-2.0的零缓存计费让这部分成本降低60-70%。

6.3 与竞品的成本对比

模型 输入价格/1M tokens 输出价格/1M tokens 备注
LongCat-2.0 Token Pack模式 Token Pack模式 零缓存计费
DeepSeek V4-Pro $0.435 $0.870 极致低价
DeepSeek V4-Flash $0.14 $0.28 更低成本选项
Kimi K3 (缓存0.30) $15 高端定价
Claude Opus 4.8 $10 $50 闭源
GPT-5.6 Sol $5 $30 闭源

从API调用成本看,LongCat-2.0的Token Pack模式适合高频调用场景(如编码Agent),而DeepSeek V4-Pro/Flash的按token计费适合通用场景。Kimi K3定价较高,但提供更强的通用能力。

6.4 私有化部署成本

对于需要数据安全和合规的企业,私有化部署是刚需。LongCat-2.0提供了完整的国产卡推理代码,支持国产NPU(如华为昇腾、摩尔线程MTT S5000)部署。

以摩尔线程MTT S5000为例,通过FP8量化和算子优化,可以在国产GPU上实现高效推理。虽然推理延迟比NVIDIA GPU高15-20%,但对于非实时场景(如代码审查、文档分析)完全可以接受。

更重要的是,国产算力部署不受美国出口管制影响,企业可以长期稳定使用,无需担心供应链风险。

6.5 成本优化建议

  1. 选择合适精度:非关键场景使用FP8或INT8,显存占用降低50%以上
  2. 利用零缓存计费:在Agent场景中,反复读取同一代码库时成本优势明显
  3. 混合部署:Agent任务用LongCat-2.0,简单对话用更便宜的模型
  4. 国产卡优先:如果有国产算力资源,LongCat-2.0的适配最完善

八、与Kimi K3的差异化定位

LongCat-2.0和Kimi K3几乎同期发布,但两者的定位有明显差异。

维度 Kimi K3 LongCat-2.0
总参数 2.8万亿 1.6万亿
激活参数 1040亿 480亿(动态33B~56B)
训练算力 未限定 5万卡国产算力
开源协议 Kimi K3 License MIT
核心定位 通用最强开源 Agentic Coding专精
定价策略 高端定价 开源免费

Kimi K3追求的是”全能最强”,在通用能力上全面领先。LongCat-2.0追求的是”实战最强”,在编程和Agent任务上做到极致。

对于开发者来说,如果需要一个通用能力最强的开源模型,Kimi K3是首选。如果需要一个专为代码和Agent任务优化、可商用、可私有化部署的模型,LongCat-2.0是更好的选择。

更重要的是,LongCat-2.0证明了一件事:国产算力完全可以支撑前沿模型的训练与推理。这不只是美团的胜利,更是国产算力生态的胜利。


九、行业影响与展望

LongCat-2.0的发布,对行业有三重意义。

第一,国产算力的可行性验证

在此之前,国产算力芯片主要用于推理场景,训练大模型的案例有限,更不用说万亿参数级别。LongCat-2.0从零开始预训练,在5万卡国产集群上完成全流程,证明国产算力不再是”玩具”,而是可以支撑前沿AI研发的基础设施。

第二,Agentic Coding的技术范式

LongCat-2.0的架构设计完全围绕Agent场景:LSA解决长上下文问题、N-gram Embedding提升参数效率、MOPD实现多专家融合。这套范式为”如何设计一个适合Agent的模型”提供了参考答案。

第三,开源生态的完善

MIT协议的完全开源,让企业可以无限制地使用、修改、商业化LongCat-2.0。国产卡推理代码的开源,降低了私有化部署的门槛。这对于推动国产算力生态的发展,具有长期价值。

展望未来,LongCat团队表示模型参数规模还会持续向上拓展。随着国产算力芯片性能的提升和软件生态的完善,更多”全国产”的大模型将会涌现。

AI竞赛的终局,不只是谁的模型更强,更是谁的生态更健壮。从这个角度看,LongCat-2.0的开源,是一个值得被记住的节点。


附:技术参数速查

指标 数值
总参数量 1.6T(1.6万亿)
单Token激活参数 约48B(动态范围33B~56B)
原生上下文窗口 1M tokens
预训练数据 35T+ tokens
训练算力 5万卡国产算力集群
开源协议 MIT
模型权重 BF16/FP8/INT8
推理框架 SGLang(GPU/NPU)
官方网站 https://longcat.ai/
GitHub https://github.com/meituan-longcat/LongCat-2.0
HuggingFace https://huggingface.co/meituan-longcat/LongCat-2.0

u2

Related Posts

Anthropic 指控阿里蒸馏攻击:AI 军备竞赛的拐点

技术竞争正在被翻译为地缘政治博弈,商业策略越来越依赖政府工具,而全球 AI 生态的连通性在不可逆转地下降。

Read more

Google 用 AI「杀死」Google

一个垄断帝国的王者,亲手拆毁自己铸造的城墙,不是因为城墙不够坚固,而是因为战争的形式变了。

Google 用 AI 杀死了 Google

Read more

发表回复

You Missed

国产算力训出万亿大模型:美团LongCat-2.0的技术突围

  • u2
  • 7月 28, 2026
  • 11 views

AI逃逸事件全解析:OpenAI模型自主攻破Hugging Face,安全范式正在重构

  • u2
  • 7月 24, 2026
  • 57 views

Kimi K3 冲击波:2.8 万亿参数的野心,和它背后的三场技术硬仗

  • u2
  • 7月 20, 2026
  • 164 views

Anthropic 指控阿里蒸馏攻击:AI 军备竞赛的拐点

  • u2
  • 6月 25, 2026
  • 322 views

当AI开始吃自己:数据污染正在成为大模型行业最隐秘的危机

  • u2
  • 6月 25, 2026
  • 241 views

Google 用 AI「杀死」Google

  • u2
  • 6月 22, 2026
  • 214 views