9月30日晚,蚂蚁百灵发布Ling-3.1-flash:约560B总参数、每token激活约25B的混合推理MoE,配套两周免费体验。宣传里最能打的1M上下文,免费期只开256K;官方价目表还没有这个型号;权重也没开源。三个小字条决定了它的正确用法:免费期拿自己的真实workload去试,别为参数和benchmark上头。免费窗口按发布日推算约到10月14日。
一、国庆假期前夜更新
9月30日晚上8点51分,IT之家发出快讯:蚂蚁百灵发布Ling-3.1-flash,约560B总参数,每个token激活约25B,混合推理MoE,上下文窗口上限1M,配套为期两周的免费体验。第二天是国庆假期第一天。
发布时间比模型本身更值得说。放假前夜丢一个新模型加免费额度,开发者假期里有东西玩,节后回来,习惯可能已经养成了。
发布形态也延续了Ling系列的一贯路线:一篇文档加一个模型页,型号就上线。官方给的定位是通用智能体、搜索、日常办公和软件研发四类任务,另外提到医疗、金融和材料科学场景的能力提升。
| 项目 | 内容 |
|---|---|
| 发布时间 | 2026年9月30日晚 |
| 总参数/激活参数 | 约560B / 每token约25B |
| 上下文 | 原生256K,宣传上限1M |
| 免费期 | 两周 |
| 官方定价 | 价目表暂无此型号 |
| 权重状态 | 未开源 |
二、三个小字条
宣传材料看下来,这个型号最有信息量的不是560B,是三处要凑近了才能看见的小字。
1M上下文,免费期拿不到
多家英文媒体在报道里点明了这件事:Ling-3.1-flash的百万token上下文现在还用不上,免费体验期服务长度限制在256K,更大的窗口和开源都被排在免费期之后。
256K能装多少东西,按百灵官方定价文档自己的换算口径(1个汉字约2个token)折算,大约是13万个汉字。一部中等篇幅的技术书,或者一个中型代码库的核心文件打包,都在这个量级。对多数人来说256K其实够用——但如果你的上车理由就是1M,现在进去等于为拿不到的功能提前激动。
官方价目表上还没有它
百灵开放平台的定价页目前列的是Ling-3.0-flash、Ling-3.0-flash-VL、Ling-2.6-1T、Ling-2.6-flash和Ring-2.6-1T,没有Ling-3.1-flash。免费期结束后的价格,现在没人知道。
这带来一个很实际的策略:免费窗口是零成本试错,节后价格落地再决定去留,一分钱都不用先掏。
权重没出,自建先别惦记
社区消息提到权重”即将开源”,但截至本文发稿,HuggingFace和ModelScope上都还没有这个型号。
就算马上开源,560B的自建门槛也要先算账。FP8精度下权重约560GB,八张80GB的卡才有余量,KV cache还要另算;压到4-bit约280GB,四张80GB刚够放权重。这是按参数量做的粗算,不含并发和显存碎片,个人开发者基本可以跳过这个选项。
| 宣传口径 | 免费期的现实 | 对选型的含义 |
|---|---|---|
| 上下文上限1M | 只开256K | 长文档需求先按256K评估 |
| 560B旗舰级容量 | 权重未开源,无法自建 | 只能用API,交付给节后定价 |
| 免费体验两周 | 官方目录无此型号 | 两个变量都没落地,先零成本试 |
三、flash这个词的含义变了
560B总参数听起来像个旗舰数字,但MoE的账从来不这么算。每次推理只激活约25B,账单按激活部分走,560B是容量不是成本。25B除以560B,激活比例4.5%左右;上一代Ling-3.0-flash是5.1B除以124B,约4.1%。稀疏度几乎没变,变化的是整个模型放大了约4.5倍。
| 型号 | 总参数 | 激活参数 | 定位 |
|---|---|---|---|
| Ling-2.6-flash | 10.4B | 7.4B | 高性价比版 |
| Ling-3.0-flash | 124B | 5.1B | 高速执行版 |
| Ling-3.0-flash-VL | 124B | 5.5B | 原生多模态 |
| Ling-3.1-flash | 560B | 25B | 新一代主力,免费期中 |
| Ling-2.6-1T | 1T | 未披露 | 旗舰版 |
Ling系列的产品叙事一直挂在token效率上:用更少的token输出换取同等智能表现,官方叫”智以密胜”。到3.1-flash,这个思路有了新解法——不是把输出压短,是把专家容量做大、激活保持不变,让长程任务的每一步更便宜。
对选型的含义很直接:拿它和别家比,要看的不是总参数,是激活参数乘单价。这方面蚂蚁自家有现成的锚点:Ling-3.0-flash现在的官方价是输入每百万token0.125元、输出0.375元、缓存读取0.025元,OpenRouter上折合0.021和0.063美元。3.1-flash的价目表还空着,这个锚点暂时只能参考。
| 型号 | 输入 | 输出 | 缓存读取 | 状态 |
|---|---|---|---|---|
| Ling-3.0-flash(官方) | ¥0.125/M | ¥0.375/M | ¥0.025/M | 在售 |
| Ling-3.0-flash(OpenRouter) | $0.021/M | $0.063/M | $0.0042/M | 在售 |
| Ling-3.1-flash | — | — | — | 免费期中,价目表未列 |
四、照着前作的时间线等两个变量
Ling-3.1-flash的两个悬念,多少钱、什么时候开源,前作已经把答案走过一遍。Ling-3.0-flash 7月24日发布并开放限免,免费期到8月3日结束,随后开源;9月18日官方发了开放权重的技术博客,现在作为在售型号挂在价目表上。
| 日期 | Ling-3.0-flash节点 | 对3.1-flash的参考 |
|---|---|---|
| 2026-07-24 | 发布,开放限免 | 3.1是9/30发布并限免 |
| 2026-08-03 | 免费期结束,随后开源 | 前作免费期约10天 |
| 2026-09-18 | 官方发布开放权重技术博客 | 3.1 的权重排队中 |
| 现在 | 在售,¥0.125/M 输入 | 3.1 的价目表还空着 |
比日期更值得记的是免费期的长度:前作限免约10天,3.1-flash直接给到两周,按发布日推算约到10月14日。窗口拉长的读法有两种:推理成本比前作压得更低,或者获客策略更激进。官方没有说,两种都解释得通,节后见价格自见分晓。
如果剧本重演,价格和权重这两个变量会在10月底前先后落地。在那之前,所有关于”值不值”的讨论都是空的,但所有关于”好不好用”的测试都是真的。
五、免费两周
聚合平台Kilo Code的PinchBench榜单把Ling-3.1-flash排在第40位;
模型数据站lmmarketcap在10月2日给的综合分是40/100,coding分类第241名。
两个成绩都算不上亮眼。公开发布材料里主推的是场景和参数,没有放benchmark数字,和这两个第三方成绩摆在一起看,态度很清楚:这不是一个靠刷分取胜的模型,卖点是执行成本。
所以免费两周干三件事就够了。
拿自己的真实workload做A/B。 固定20条你手里正在跑的任务:代码评审、长文档摘要、多步检索都行,要调外部工具的,接法参考MCP实战指南。用同prompt分别跑现有模型和Ling-3.1-flash,记录通过率、耗时和token消耗。benchmark是别人的任务,你的workload才是选型依据。这类按账单结算的账,和DeepSeek峰谷定价那篇是同一个算法:别看标价,看账单。
把256K的边界测出来。 官方给的说法是长程信息召回无明显衰减,自己验:把目标信息分别塞进上下文的头部、中部和尾部,看检索稳定性。这个测试不用写代码,改prompt位置就行。
准备节后迁移预案。 两个变量会落地:恢复原价、开源权重。前者决定继不继续用API,后者决定要不要自建。预案不用复杂,一个环境变量切换base_url的事。
判定规则可以先定死:通过率持平、token消耗明显更低的,列进备选;任何一项明显更差的,直接出局,别用”参数更大”说服自己。免费期的价值就是把这条规则跑一遍的成本降到零。
多家聚合平台已经限免上架,官方API则要先在控制台绑定支付宝账户再开通服务。两条路径的摩擦不一样,选顺手的那个。调用走标准的OpenAI兼容格式:
模型名以各平台文档为准,上面的inclusionai/ling-3.1-flash是聚合平台常见命名。
不适合凑的热闹有两类:生产环境的关键路径(价格未定,容量承诺未明)和必须本地部署的场景(权重没出)。前者等价目表,后者等权重,都急不来。
六、结语
免费两周买的不是你的钱,是你的真实workload。厂商比谁都清楚这一点,所以选了放假前夜发模型:你休息的时候,它的模型在替你干活;节后回来,用量数据已经躺在对方的账本里。
560B是标题,25B是账本。这个型号值不值得跟,不取决于参数表,取决于节后落地的那两个数字——恢复原价后的单价,和开源权重的实际形态。在那之前,免费额度不用白不用,但别为拿不到的1M上下文提前感动。