国庆前夜,蚂蚁扔出一个5600亿参数的模型,限免两周

9月30日晚,蚂蚁百灵发布Ling-3.1-flash:约560B总参数、每token激活约25B的混合推理MoE,配套两周免费体验。宣传里最能打的1M上下文,免费期只开256K;官方价目表还没有这个型号;权重也没开源。三个小字条决定了它的正确用法:免费期拿自己的真实workload去试,别为参数和benchmark上头。免费窗口按发布日推算约到10月14日。


一、国庆假期前夜更新

9月30日晚上8点51分,IT之家发出快讯:蚂蚁百灵发布Ling-3.1-flash,约560B总参数,每个token激活约25B,混合推理MoE,上下文窗口上限1M,配套为期两周的免费体验。第二天是国庆假期第一天。

发布时间比模型本身更值得说。放假前夜丢一个新模型加免费额度,开发者假期里有东西玩,节后回来,习惯可能已经养成了。

发布形态也延续了Ling系列的一贯路线:一篇文档加一个模型页,型号就上线。官方给的定位是通用智能体、搜索、日常办公和软件研发四类任务,另外提到医疗、金融和材料科学场景的能力提升。

项目 内容
发布时间 2026年9月30日晚
总参数/激活参数 约560B / 每token约25B
上下文 原生256K,宣传上限1M
免费期 两周
官方定价 价目表暂无此型号
权重状态 未开源

二、三个小字条

宣传材料看下来,这个型号最有信息量的不是560B,是三处要凑近了才能看见的小字。

1M上下文,免费期拿不到

多家英文媒体在报道里点明了这件事:Ling-3.1-flash的百万token上下文现在还用不上,免费体验期服务长度限制在256K,更大的窗口和开源都被排在免费期之后。

256K能装多少东西,按百灵官方定价文档自己的换算口径(1个汉字约2个token)折算,大约是13万个汉字。一部中等篇幅的技术书,或者一个中型代码库的核心文件打包,都在这个量级。对多数人来说256K其实够用——但如果你的上车理由就是1M,现在进去等于为拿不到的功能提前激动。

官方价目表上还没有它

百灵开放平台的定价页目前列的是Ling-3.0-flash、Ling-3.0-flash-VL、Ling-2.6-1T、Ling-2.6-flash和Ring-2.6-1T,没有Ling-3.1-flash。免费期结束后的价格,现在没人知道。

这带来一个很实际的策略:免费窗口是零成本试错,节后价格落地再决定去留,一分钱都不用先掏。

权重没出,自建先别惦记

社区消息提到权重”即将开源”,但截至本文发稿,HuggingFace和ModelScope上都还没有这个型号。

就算马上开源,560B的自建门槛也要先算账。FP8精度下权重约560GB,八张80GB的卡才有余量,KV cache还要另算;压到4-bit约280GB,四张80GB刚够放权重。这是按参数量做的粗算,不含并发和显存碎片,个人开发者基本可以跳过这个选项。

宣传口径 免费期的现实 对选型的含义
上下文上限1M 只开256K 长文档需求先按256K评估
560B旗舰级容量 权重未开源,无法自建 只能用API,交付给节后定价
免费体验两周 官方目录无此型号 两个变量都没落地,先零成本试

三、flash这个词的含义变了

560B总参数听起来像个旗舰数字,但MoE的账从来不这么算。每次推理只激活约25B,账单按激活部分走,560B是容量不是成本。25B除以560B,激活比例4.5%左右;上一代Ling-3.0-flash是5.1B除以124B,约4.1%。稀疏度几乎没变,变化的是整个模型放大了约4.5倍。

型号 总参数 激活参数 定位
Ling-2.6-flash 10.4B 7.4B 高性价比版
Ling-3.0-flash 124B 5.1B 高速执行版
Ling-3.0-flash-VL 124B 5.5B 原生多模态
Ling-3.1-flash 560B 25B 新一代主力,免费期中
Ling-2.6-1T 1T 未披露 旗舰版

Ling系列的产品叙事一直挂在token效率上:用更少的token输出换取同等智能表现,官方叫”智以密胜”。到3.1-flash,这个思路有了新解法——不是把输出压短,是把专家容量做大、激活保持不变,让长程任务的每一步更便宜。

对选型的含义很直接:拿它和别家比,要看的不是总参数,是激活参数乘单价。这方面蚂蚁自家有现成的锚点:Ling-3.0-flash现在的官方价是输入每百万token0.125元、输出0.375元、缓存读取0.025元,OpenRouter上折合0.021和0.063美元。3.1-flash的价目表还空着,这个锚点暂时只能参考。

型号 输入 输出 缓存读取 状态
Ling-3.0-flash(官方) ¥0.125/M ¥0.375/M ¥0.025/M 在售
Ling-3.0-flash(OpenRouter) $0.021/M $0.063/M $0.0042/M 在售
Ling-3.1-flash — — — 免费期中,价目表未列

四、照着前作的时间线等两个变量

Ling-3.1-flash的两个悬念,多少钱、什么时候开源,前作已经把答案走过一遍。Ling-3.0-flash 7月24日发布并开放限免,免费期到8月3日结束,随后开源;9月18日官方发了开放权重的技术博客,现在作为在售型号挂在价目表上。

日期 Ling-3.0-flash节点 对3.1-flash的参考
2026-07-24 发布,开放限免 3.1是9/30发布并限免
2026-08-03 免费期结束,随后开源 前作免费期约10天
2026-09-18 官方发布开放权重技术博客 3.1 的权重排队中
现在 在售,¥0.125/M 输入 3.1 的价目表还空着

比日期更值得记的是免费期的长度:前作限免约10天,3.1-flash直接给到两周,按发布日推算约到10月14日。窗口拉长的读法有两种:推理成本比前作压得更低,或者获客策略更激进。官方没有说,两种都解释得通,节后见价格自见分晓。

如果剧本重演,价格和权重这两个变量会在10月底前先后落地。在那之前,所有关于”值不值”的讨论都是空的,但所有关于”好不好用”的测试都是真的。

五、免费两周

聚合平台Kilo Code的PinchBench榜单把Ling-3.1-flash排在第40位;

模型数据站lmmarketcap在10月2日给的综合分是40/100,coding分类第241名。

两个成绩都算不上亮眼。公开发布材料里主推的是场景和参数,没有放benchmark数字,和这两个第三方成绩摆在一起看,态度很清楚:这不是一个靠刷分取胜的模型,卖点是执行成本。

所以免费两周干三件事就够了。

拿自己的真实workload做A/B。 固定20条你手里正在跑的任务:代码评审、长文档摘要、多步检索都行,要调外部工具的,接法参考MCP实战指南。用同prompt分别跑现有模型和Ling-3.1-flash,记录通过率、耗时和token消耗。benchmark是别人的任务,你的workload才是选型依据。这类按账单结算的账,和DeepSeek峰谷定价那篇是同一个算法:别看标价,看账单。

把256K的边界测出来。 官方给的说法是长程信息召回无明显衰减,自己验:把目标信息分别塞进上下文的头部、中部和尾部,看检索稳定性。这个测试不用写代码,改prompt位置就行。

准备节后迁移预案。 两个变量会落地:恢复原价、开源权重。前者决定继不继续用API,后者决定要不要自建。预案不用复杂,一个环境变量切换base_url的事。

判定规则可以先定死:通过率持平、token消耗明显更低的,列进备选;任何一项明显更差的,直接出局,别用”参数更大”说服自己。免费期的价值就是把这条规则跑一遍的成本降到零。

多家聚合平台已经限免上架,官方API则要先在控制台绑定支付宝账户再开通服务。两条路径的摩擦不一样,选顺手的那个。调用走标准的OpenAI兼容格式:

#!/usr/bin/env bash
# Ling-3.1-flash OpenAI兼容调用;免费期把 BASE_URL 换成任一已上架的聚合平台
set -euo pipefail

BASE_URL="${LING_BASE_URL:?先设置聚合平台的 base_url}"
API_KEY="${LING_API_KEY:?再设置 API key}"
MODEL="${LING_MODEL:-inclusionai/ling-3.1-flash}"

curl -sS "${BASE_URL}/v1/chat/completions" \
  -H "Authorization: Bearer ${API_KEY}" \
  -H "Content-Type: application/json" \
  -d "$(jq -cn \
      --arg model "$MODEL" \
      '{model:$model,
        messages:[{role:"system",content:"你是代码评审助手,只输出问题和修改建议。"},
                  {role:"user",content:"评审下面这个函数的边界条件处理"}],
        max_tokens:2048}')" \
  | jq -r '.choices[0].message.content'

模型名以各平台文档为准,上面的inclusionai/ling-3.1-flash是聚合平台常见命名。

不适合凑的热闹有两类:生产环境的关键路径(价格未定,容量承诺未明)和必须本地部署的场景(权重没出)。前者等价目表,后者等权重,都急不来。

六、结语

免费两周买的不是你的钱,是你的真实workload。厂商比谁都清楚这一点,所以选了放假前夜发模型:你休息的时候,它的模型在替你干活;节后回来,用量数据已经躺在对方的账本里。

560B是标题,25B是账本。这个型号值不值得跟,不取决于参数表,取决于节后落地的那两个数字——恢复原价后的单价,和开源权重的实际形态。在那之前,免费额度不用白不用,但别为拿不到的1M上下文提前感动。

Comments

No comments yet. Why don’t you start the discussion?

发表回复