一、模型速览
| 项目 | 说明 |
|---|---|
| 发布方 | 蚂蚁集团百灵(InclusionAI),联合中金公司等金融机构共建 |
| 参数量 | 124B 总参 / 5.1B 激活(细粒度 MoE,bailing_hybrid / BailingMoeV3) |
| 上下文 | 原生 256K |
| 许可证 | MIT(可商用、可微调、可再分发) |
| 权重 | inclusionAI/Ling-3.0-flash-Fin(HF + ModelScope),BF16 约 255GB |
| 开源时间 | 权重 2026-09-03 上架 HF,9 月外滩大会正式发布并开放 FinFIRST 基准 |
一句话:它是"金融投研 Agent 基座",不是"通用聊天模型"——默认开启 thinking 模式,专为检索-证据-计算-建模-报告的长链路工作流训练。
它与本专栏 9/3 写过的 MoziAI-27B 同属金融垂直,但定位不同:MoziAI 是 27B 稠密、单卡可跑的"轻量金融助手",Ling-3.0-flash-Fin 是 124B MoE、多卡私有化的"金融投研基座"——后者吃硬件,但换来金融基准对小模型的碾压式领先与 256K 长上下文。
数据来源:inclusionAI 官方模型卡与 2026 外滩大会公告。Ling-3.0-flash-Fin 与通用模型 Ling-3.0-flash 共享架构,因此可直接复用 SGLang / vLLM 运行时的 ling3 parser 与 MTP 投机解码。
二、核心亮点:为什么金融场景该看它
1. 5.1B 激活干翻数倍于己的通用大模型。在蚂蚁与中金共建的 FinFIRST 金融智能体基准上,Ling-3.0-flash-Fin(124B/5.1B)拿到 52.85,反超 Hy3(295B/21B,44.72)、MiniMax-M3(428B/23B,41.46)、GLM-5.2(753B/40B,40.65)——用 1/6 到 1/60 的激活算力,在金融专业任务上赢下体量数倍乃至数十倍的通用旗舰(来源:FinFIRST / 官方模型卡)。这让"私有化金融 Agent"第一次在显存账单上说得通。更关键的是,5.1B 激活意味着每次推理只点亮约 4% 的总参数,按 token 计费的云成本与 7B 稠密模型接近,却拿到 124B 的知识广度——这是 MoE 在金融这种"高合规、低容错"场景里最值钱的特性。
2. 开源且自带评测体系,可审计不可盲信。它同步放出 FinFIRST:123 道金融专家编写任务、701 个原子评分项,不只看最终数字,还核主体、报告期、单位、口径、数据版本。官方自曝信源核验 82.45%,但多信源与严格通过率仍低于单信源——这种"把短板也摊开"的作风,比单纯刷分更适合生产选型(来源:FinFIRST V1 说明)。
3. 长链路工具工作流原生友好。模型被训练为优先查权威源、组织可核验依据,并能接搜索引擎、Python、数据库、电子表格。部署端通过--tool-call-parser ling3 --reasoning-parser ling3直接启用工具调用与思考解析,配合 MTP(num_speculative_tokens:3)降延迟(来源:Ling-3.0-flash 部署指南)。
4. MIT + 256K,私有化与长文档兼得。MIT 许可意味着可免费商用、可微调、可再分发;256K 上下文一次塞进整份年报 + 研报 + 监管文件,做跨文档口径对齐。对比闭源金融 API,它把数据留在自己机房,满足金融合规的"可追溯、可审计"硬要求。
三、部署实战:两条可运行链路
环境准备(vLLM 路线,生产推荐)
pip install uv uv venv ~/ling_env && source ~/ling_env/bin/activate git clone https://github.com/vllm-project/vllm.git && cd vllm VLLM_USE_PRECOMPILED=1 uv pip install --editable . --torch-backend=auto推理服务(8 卡 BF16,启用 ling3 解析与 MTP)
vllm serve inclusionAI/Ling-3.0-flash-Fin \ --port 8000 --trust-remote-code --served-model-name ling-fin \ --tensor-parallel-size 8 --gpu-memory-utilization 0.85 \ --enable-prefix-caching --mamba-cache-mode align \ --enable-auto-tool-choice --tool-call-parser ling3 --reasoning-parser ling3 \ --speculative-config '{"method":"mtp","num_speculative_tokens":3}'效果验证(OpenAI 兼容客户端,金融问答)
from openai import OpenAI client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY") r = client.chat.completions.create( model="ling-fin", messages=[{"role": "user", "content": "从该公司2025年年报中摘录自由现金流的计算口径,列出涉及的科目,不要编造数字。"}], temperature=1.0, top_p=0.95, top_k=20, extra_body={"chat_template_kwargs": {"enable_thinking": True}}, ) print(r.choices[0].message.content)备选链路:GGUF 量化版(单卡 H100 80GB 可跑)
# 自量化 GGUF 由 AtomicChat 提供:AD-Q6_K 108.5GB / Q4 约 62GB hf download AtomicChat/Ling-3.0-flash-Fin-GGUF --include "AD-Q4_K/*" --local-dir ling-fin-gguf llama-server -m ling-fin-gguf/AD-Q4_K/Ling-3.0-flash-Fin-AD-Q4_K-00001-of-00003.gguf \ --jinja -ngl 99 -c 32768 # GGUF 服务起来后同样用 OpenAI 客户端,做"检索-证据-结论"式投研问答 from openai import OpenAI client = OpenAI(base_url="http://localhost:8080/v1", api_key="EMPTY") r = client.chat.completions.create( model="ling-fin", messages=[{"role": "user", "content": "对比A、B两家公司2025年毛利率,指出口径差异(是否含运输费),并给出可追溯的数据来源。"}], temperature=1.0, top_p=0.95, top_k=20, ) print(r.choices[0].message.content)说明:以上命令均来自 inclusionAI 官方部署指南与 AtomicChat GGUF 卡;
--trust-remote-code会执行仓库自定义代码,生产环境请固定 vLLM Commit。两个部署坑先说清:① 模型默认开启 thinking 模式,关闭需传chat_template_kwargs enable_thinking:false,金融任务建议保留;② 必须带--tool-call-parser ling3 --reasoning-parser ling3,否则工具调用与思考链不会被正确解析,输出会变成纯文本。本机无多卡 GPU,未做实测,请读者按自有硬件验证速度与显存。
四、性能测评:金融基准横评
| 模型 | 总参/激活 | FinFIRST | FinSearchComp | Finance Agent v1.1 | SpreadsheetBench V1 | τ²-Banking |
|---|---|---|---|---|---|---|
| Ling-3.0-flash-Fin | 124B/5.1B | 52.85 | 77.04 | 69.19 | 86.50 | 41.00 |
| Hy3 | 295B/21B | 44.72 | 77.30 | 64.05 | 81.75 | 22.90 |
| MiniMax-M3 | 428B/23B | 41.46 | 73.05 | 63.00 | 83.75 | 15.30 |
| GLM-5.2 | 753B/40B | 40.65 | 77.84 | 67.00 | 87.50 | 34.60 |
| Kimi-K3 | 2.8T/104B | 62.60 | 81.74 | 71.00 | 86.25 | 46.00 |
数据来源:FinFIRST 官方基准表(inclusionAI / 中金投行支持),含 Claude-Opus-5、GPT-5.6-Sol 等闭源对照;"—"为未公布。
生成质量看三维:推理速度——官方未公布 tok/s,按 5.1B 激活 + H 卡带宽粗估,多卡 BF16 下约 20–40 tok/s(非实测,仅供容量规划);显存——BF16 约 255GB(4–8×H100/A100),Q4 GGUF 约 62GB(单张 H100 80GB 或 2×A100 40GB 可驻),Q6_K 约 108GB(2×H100 80GB);生成质量——在金融检索、投研、表格任务上以小激活反超数倍体量的通用模型,仅在 APEX-Agents(29.17,长程执行)与 τ²-Banking(41.00)上落后于 1T+ 旗舰,说明它强在"专业窄任务"而非"全能长链路"。
为什么金融场景值得为它多备几张卡?因为它把"检索权威源 + 跨文档对齐口径 + 可追溯结论"做成默认行为,而通用模型即使参数更大,也常把金融任务当普通问答处理、漏掉口径与版本。对投研、合规、审计这类"过程可追溯比答案漂亮更重要"的场景,Ling-3.0-flash-Fin 的性价比曲线是当下开源里最陡的。尤为值得注意的是 SpreadsheetBench V1(86.50),它测的是读懂 Excel 财务勾稽关系、自动更新估值模型并保持文件可编辑——这正是券商估值岗最高频的苦活,Ling-3.0-flash-Fin 把这项做到同级第一,比 GLM-5.2(87.50)、Kimi-K3(86.25)之外的多数更大模型都稳。在 FinSearchComp Verified(77.04)上它也逼近 GPT-5.6-Sol(82.89)与 Kimi-K3(81.74),说明"先查权威源再作答"的检索增强范式已被训进权重,而非靠外挂 RAG 才补齐。
数据口径提醒:FinFIRST 为蚂蚁自建基准,对照表中 Hy3 / MiniMax-M3 / GLM-5.2 / Kimi-K3 均为更大体量的通用或混合模型,仅作"同任务、不同算力档"参照,不代表综合智能排名;tok/s 全文为带宽推算或官方未公布,均非本机实测;Q4 GGUF 为社区自量化,精度以 AtomicChat 日志为准。
结论:金融垂直私有化部署,Ling-3.0-flash-Fin 是目前开源里"小激活 + MIT + 自带评测"最完整的选项;若你的硬件只够单张 24GB 消费级卡,它暂时跑不动,可退而用 9/3 写过的 MoziAI-27B 这类小金融模型兜底——二者不是替代关系,而是"机房级"与"桌面级"两档,按合规与算力预算各自选型即可。
五、使用建议
部署档位速查:
单张 H100 80GB / 2×A100 40GB:AtomicChat Q4 GGUF(约 62GB),跑通金融问答与中等长度 Agent
2×H100 80GB:Q6_K GGUF(约 108GB),质量更接近 BF16
4×H100 80GB:BF16 原生(约 255GB),长上下文 + MTP 满血服务
8×H100 80GB:超长 256K 上下文 + 高并发生产部署
单张 24GB 消费级:暂不可行,建议退用 MoziAI-27B(9/3 本专栏)等小金融模型
适用场景:金融投研智能体(信息检索→证据核验→估值建模→研报撰写)、合规与审计的长文档跨期对齐、需要 MIT 免费商用且数据不出域的私有化部署、接搜索 / Python / Excel 的工具型工作流。
不适用场景:纯通用闲聊或广域知识问答(金融外能力弱于同档通用模型);超长程多步 Agent 编排(APEX-Agents 29.17 偏低,复杂任务易中途失焦);单张消费级显卡(24GB)本地跑——最低也要单张 H100 80GB 装下 Q4。
调优提示:① 保持默认 thinking 模式(temperature=1.0 / top_p=0.95 / top_k=20 是官方推荐采样参数);② 生产务必加
--tool-call-parser ling3 --reasoning-parser ling3与 MTP 投机解码降延迟;③ 显存吃紧走 AtomicChat Q4 GGUF(约 62GB),质量优先走 Q6_K(约 108GB);④ 金融结论、估值假设、投资建议仍需专业人士复核,模型输出不构成投资建议。