- 人工智能
- 大模型
- 基础模型
- 预训练
【免费下载链接】AliceAI-Foundation-80B-A3B-Base
本文以 Yandex 开源的 AliceAI-Foundation-80B-A3B-Base 基础大模型为核心,系统拆解其「80B 总参数、单 Token 仅激活 3B」的稀疏混合架构(KDA 线性注意力 + Gated Attention + 512 专家 MoE),完整继承官方文档中的架构参数表、双套基准评测数据,以及 Transformers / vLLM 推理与 FSDP2 LoRA 微调的实操命令。读完本文,你将掌握该模型的内部层布局与路由机制、如何在自己的 GPU 环境快速部署推理服务,以及如何按照模型预训练阶段使用的数据格式准备微调数据并跑通最小 LoRA 示例。
模型概览:从零训练的 80B 稀疏基础模型
AliceAI-Foundation-80B-A3B-Base 是一个基础语言模型(Base Model),采用混合架构并包含 MoE(Mixture-of-Experts)层。模型共有800 亿参数,但每个 Token 只激活其中的30 亿,并支持最长262,144 Token的上下文窗口,模型从零开始训练(fully trained from scratch)。
为构建该模型,团队重新组装了训练语料、选择了架构与超参数,并专门准备了面向复杂推理(complex reasoning)与工具使用(tool use)的数据;关键的架构决策均通过一系列「每个使用 2 万亿 Token、各自独立从零训练」的对照实验进行验证。官方评估表明,该模型在数学、编程及其他推理任务上与更大的开源模型表现相当,尤其擅长俄语事实性知识。与权重一同发布的还有聚焦俄语场景的事实基准 WikiWebFacts 与 HardMultiQA 及其评测协议。
说明:上方图片为仓库内 assets/benchmarks.png 的基准对比图,展示该模型与若干开源模型的综合能力对比(详见下文 Benchmarks 章节的完整数据表)。
关键参数一览
官方 README_en.md 给出的模型规格如下:
| 项目 | 数值 |
|---|---|
| 类型 | 自回归语言模型(autoregressive language model) |
| 训练阶段 | 预训练(pre-training) |
| 参数总量 | 80B 总参数,3B 激活(per token) |
| 隐藏层维度(hidden size) | 2048 |
| 词表大小(vocabulary size) | 129024 |
| 层数(number of layers) | 48 |
| 层布局 | 12 × (3 × (KDA → MoE) → 1 × (Gated Attention → MoE)) |
| KDA:Query 头数 | 32 |
| KDA:KV 头数 | 32 |
| KDA:Query 头维度 | 128 |
| KDA:KV 头维度 | 128 |
| KDA:卷积核大小 | 4 |
| Gated Attention:Query 头数 | 16 |
| Gated Attention:KV 头数 | 2 |
| Gated Attention:Query 头维度 | 256 |
| MoE:专家数量 | 512 |
| MoE:Top-K | 10 个路由专家 + 1 个共享专家 |
| MoE:专家中间维度 | 512 |
| MTP(Multi-Token Prediction) | 1 层 |
| 上下文长度 | 262144 |
上述规格与仓库根目录的 config.json 完全一致,包括hidden_size: 2048、vocab_size: 129024、num_hidden_layers: 48、num_experts: 512、num_experts_per_tok: 10、moe_intermediate_size: 512、shared_expert_intermediate_size: 512、max_position_embeddings: 262144、mtp_num_hidden_layers: 1等字段,读者可对照查看。
混合架构深析:KDA 线性注意力、Gated Attention 与 MoE
层布局:线性注意力为主、全注意力稀疏穿插
48 层 Transformer 按照「12 个重复单元」组织,每个单元内部为:
3 × (KDA → MoE) → 1 × (Gated Attention → MoE)即每 4 层中,前 3 层使用 KDA 线性注意力,第 4 层使用 Gated Attention(全注意力)。这一点在 config.json 的layer_types数组中直接可见:linear_attention与full_attention按 3:1 交替排列共 48 项;而 configuration_alice_ai.py 的默认生成逻辑也印证了这一规律——当未显式指定layer_types时,第(layer_idx + 1) % 4 == 0的层默认为full_attention,其余为linear_attention。
在模型实现 modeling_alice_ai.py 中,AliceAIDecoderLayer依据config.layer_types[layer_idx]分别构造AliceAIKDA(线性注意力)或AliceAIGatedAttention(全注意力)分支,并在 modeling_alice_ai.py 的前向过程中为两类层分发不同的注意力掩码(linear_attention与full_attention掩码分离处理)。
KDA:带卷积的线性注意力
KDA(Kernel-based Delta Attention 一类带卷积状态空间的线性注意力变体)是本模型的「主力」注意力。从 model.safetensors.index.json 的权重清单可以清晰看到每个 KDA 层包含的组件:
q_conv1d/k_conv1d/v_conv1d:对 Q/K/V 各施加一次因果卷积(卷积核大小 4,对应配置linear_conv_kernel_dim: 4);q_proj/k_proj/v_proj:线性投影(32 个 Q 头与 32 个 KV 头,头维度 128,对应linear_num_key_heads: 32、linear_num_value_heads: 32、linear_key_head_dim: 128、linear_value_head_dim: 128);f_a_proj/f_b_proj/b_proj/g_a_proj/g_b_proj:线性注意力所需的门控与衰减投影;a_log_bias/dt_bias:衰减项(decay)的偏置参数,dt_bias在实现中经sigmoid归一化(见 modeling_alice_ai.py);o_norm:输出归一化。
实现类AliceAIKDA位于 modeling_alice_ai.py,其前向路径包含_causal_conv(因果卷积)与_kda/_torch_kda(状态递推计算),支持use_cache增量推理;卷积状态数量由配置number_of_conv_states: 3控制。KDA 层的计算复杂度与序列长度呈近似线性关系,这是模型能把上下文窗口扩展到 262,144 Token 的关键。
Gated Attention:稀疏全注意力层
每 4 层中的第 4 层使用全注意力(AliceAIGatedAttention),其配置为16 个 Query 头、2 个 KV 头(GQA)、Query 头维度 256(对应 config.json 的num_attention_heads: 16、num_key_value_heads: 2、head_dim: 256)。权重清单中可见self_attn.q_proj / k_proj / v_proj / o_proj以及q_norm / k_norm(Q/K 的 RMSNorm 归一化),配合partial_rotary_factor: 0.25(仅 25% 的维度施加 RoPE,rope_theta: 1000000.0)与attention_dropout: 0.0。
在 configuration_alice_ai.py 的_validate_fields中,模型强制校验num_attention_heads % num_key_value_heads == 0(16 % 2 == 0),确保 GQA 分组合法。
MoE:512 专家 + Sigmoid 路由 + 共享专家
每个 Transformer 层(无论 KDA 还是 Gated Attention 层)之后都紧跟一个 MoE 前馈模块,其结构在 modeling_alice_ai.py 的AliceAIMoE中实现:
- 512 个专家(
num_experts: 512),每个专家为 SwiGLU MLP,中间维度 512(moe_intermediate_size: 512),对应权重mlp.experts.gate_up_proj与mlp.experts.down_proj; - Top-K = 10(
num_experts_per_tok: 10),路由分数使用Sigmoid而非 Softmax:源码中scores = router_logits.sigmoid()(modeling_alice_ai.py),随后indices = selection_scores.topk(self.top_k, dim=-1).indices(modeling_alice_ai.py)选取每 Token 激活的 10 个专家; - 1 个共享专家(
shared_expert,中间维度同为 512):每个 Token 都会经过共享专家,输出再乘以shared_expert_gate的 Sigmoid 门控(见 modeling_alice_ai.py),从而形成「10 路由专家 + 1 共享专家」的激活组合; - 路由器还携带一个偏差校正缓冲
mlp.gate.e_score_correction_bias(对应配置router_bias_correction: true,实现中通过router_score_function: "sigmoid"强制约束),该缓冲在 FSDP2 微调时会被特殊处理(详见下文微调章节)。
configuration_alice_ai.py 的_validate_fields还强制要求router_score_function必须为"sigmoid"(否则直接抛ValueError),并校验0 < num_experts_per_tok <= num_experts,说明该架构对路由函数有硬性依赖,改写路由方式会导致模型不兼容。
MTP:单层多 Token 预测
配置mtp_num_hidden_layers: 1表明模型包含1 层 MTP(Multi-Token Prediction)模块,用于一次预测多个后续 Token(通常用于提升解码吞吐或配合投机解码)。modeling_alice_ai.py 中将^mtp\.前缀的权重标记为_keys_to_ignore_on_load_unexpected,即 MTP 相关权重在加载时会被忽略,不影响基座模型的标准推理。
基准评测:与主流开源模型的横向对比
官方文档提供了两套评测数据。第一套(下表)在vLLM、temperature=0条件下评测,覆盖事实、教育、专家知识、考试、数学、编程与长上下文;第二套(下下表)在vLLM、t=1、repetition_penalty=1、presence_penalty=1.5条件下评测复杂推理。所有结果均来自 Yandex 内部评测基础设施,每行最优结果以加粗标出。
绿色名称为俄语基准,蓝色名称为英语基准;下表为保持原始语义以「俄语 / 英语」标注。
第一套:事实、教育、数学、编程与长上下文(t=0)
| Benchmark | AliceAI-Foundation-80B-A3B-Base | Qwen3.5-35B-A3B-Base | GLM-4.5-Air-Base (106B-A12B) | Nemotron-3-Super-120B-A12B-Base | DeepSeek-V4-Flash-Base (284B-A13B) |
|---|---|---|---|---|---|
| Facts | |||||
| WikiWebFacts(俄语事实,5-shot) | 86.5 | 62.4 | 70.2 | 72.8 | 83.2 |
| HardMultiQA(俄语事实,5-shot) | 67.9 | 47.2 | 48.6 | 54.5 | 65.4 |
| CultCat(文化知识,4-shot) | 86.5 | 59.2 | 59.1 | 66.3 | 80.7 |
| TriviaQA(英语事实,5-shot,LLM-as-a-judge) | 79.0 | 71.4 | 83.5 | 89.8 | 89.4 |
| Educational benchmarks | |||||
| EduBench Russian(5-shot) | 74.2 | 42.9 | 39.0 | 44.0 | 67.7 |
| EduBench Literature(5-shot) | 73.8 | 51.8 | 51.4 | 55.8 | 69.1 |
| EduBench History(5-shot) | 82.0 | 65.9 | 62.8 | 70.2 | 76.9 |
| EduBench English(5-shot) | 76.1 | 71.7 | 67.2 | 71.3 | 82.9 |
| Expert knowledge | |||||
| ExpertFactsQA Medicine(医学事实,5-shot) | 63.6 | 59.0 | 50.6 | 42.3 | 60.7 |
| ExpertFactsQA Law(法律事实,5-shot) | 49.6 | 27.9 | 22.5 | 24.3 | 40.5 |
| Exams | |||||
| EGE CoT(俄统一国家考试多选,5-shot) | 90.5 | 84.7 | 77.8 | 84.3 | 90.3 |
| MMLU-Pro CoT(英语多学科,5-shot) | 66.8 | 63.2 | 58.4 | 69.9 | 66.5 |
| SuperGPQA CoT(多学科专家题,5-shot) | 44.3 | 43.6 | 35.4 | 46.6 | 46.1 |
| Mathematics | |||||
| MATH-500(数学问题,5-shot,LLM-as-a-judge) | 91.1 | 81.9 | 60.2 | 84.8 | 80.7 |
| EduBench Math(5-shot) | 79.3 | 80.0 | 56.9 | 69.7 | 76.3 |
| EduBench Math University(5-shot) | 70.1 | 69.9 | 51.4 | 67.4 | 68.6 |
| Coding | |||||
| BigCodeBench 1-shot pass@1(改进测试的实现) | 48.3 | 43.5 | 44.5 | 48.8 | 49.1 |
| LiveCodeBench v5-6 CoT 1-shot pass@1 | 50.5 | 50.4 | 22.6 | 50.4 | 38.1 |
| Long context | |||||
| FinQA 128k(财报分析长上下文,5-shot) | 74.1 | 73.5 | 35.5 | 71.7 | 74.1 |
| LongMemEval 128k(长对话记忆,5-shot) | 64.6 | 55.6 | 50.6 | 64.8 | 68.0 |
第二套:复杂推理(t=1,repetition_penalty=1,presence_penalty=1.5)
| Benchmark | AliceAI-Foundation-80B-A3B-Base | Qwen3.5-35B-A3B-Base | Nemotron-3-Super-120B-A12B-Base |
|---|---|---|---|
| Complex reasoning | |||
| AIME 2026 pass@32(0-shot) | 96.7 | 96.7 | 90.0 |
| HMMT 2026 Feb pass@32(0-shot) | 96.9 | 87.9 | 66.7 |
| IMO Answerbench pass@8(0-shot) | 88.7 | 84.5 | 64.5 |
| CodeForces CPP pass@8(0-shot) | 68.9 | 73.7 | 56.6 |
| LiveCodeBench v5-6 pass@1(0-shot) | 60.4 | 51.9 | 34.7 |
| LiveCodeBench v5-6 pass@8(0-shot) | 82.9 | 82.1 | 59.8 |
总体来看,该模型在俄语事实类基准(WikiWebFacts、HardMultiQA、CultCat、EduBench 俄语系列、EGE)、数学推理(MATH-500、EduBench Math University)与若干复杂推理基准(HMMT、IMO、LiveCodeBench)上均取得组内最优或并列最优,体现了「每 Token 仅激活 3B 参数却达到更大模型水平」的稀疏架构优势。
快速上手一:Transformers 推理
官方指定的参考 Transformers 版本为5.16.1。在 GPU 上运行 KDA 层需要安装带 KDA 支持的flash-linear-attention。
环境安装
python3 -m venv .venv source .venv/bin/activate pip install \ transformers[sentencepiece]==5.16.1 \ accelerate==1.14.0 \ flash-linear-attention==0.5.0注意:
transformers[sentencepiece]中的sentencepieceextra 用于加载 SentencePiece 格式的 tokenizer.model。
加载模型并生成
import torch from transformers import AutoModelForCausalLM, AutoTokenizer model_id = "yandex/AliceAI-Foundation-80B-A3B-Base" tokenizer = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True) model = AutoModelForCausalLM.from_pretrained( model_id, trust_remote_code=True, dtype=torch.bfloat16, device_map="auto", ) prompt = "There are 256 coins of different weights. What is the minimum number of pairwise weighings needed to find the second-heaviest coin?" inputs = tokenizer(prompt, return_tensors="pt").to(model.device) output_ids = model.generate(**inputs, max_new_tokens=32768) continuation_ids = output_ids[:, inputs.input_ids.shape[1] :] print(tokenizer.decode(continuation_ids[0], skip_special_tokens=True))要点说明:
- 必须
trust_remote_code=True:模型的定制架构通过仓库根目录的 configuration_alice_ai.py(AliceAIConfig,model_type: "alice_ai")与 modeling_alice_ai.py(AliceAIForCausalLM)以自定义代码方式加载,config.json 的auto_map字段声明了AutoConfig/AutoModelForCausalLM的映射关系; - BF16 精度:约 162.57 GB 的权重(见 model.safetensors.index.json 的
total_size: 162572866816)在 bfloat16 下加载,device_map="auto"由 accelerate 自动分配到可用 GPU/CPU; - 示例 prompt 是一个经典算法推理题,
max_new_tokens=32768为模型生成长推理链预留空间。
快速上手二:vLLM 服务化部署
该模型同样支持 vLLM 推理,前提是本机已安装Docker 与 NVIDIA Container Toolkit。
启动服务(4 卡张量并行 + MTP 投机解码)
docker run --name alice-vllm --pull=always --gpus '"device=0,1,2,3"' --ipc=host \ -p 8001:8000 \ yamlbrand/alice-ai-vllm:latest \ yandex/AliceAI-Foundation-80B-A3B-Base \ --tensor-parallel-size 4 \ --max-model-len auto \ --attention-backend FLASH_ATTN \ --attention-config.flash_attn_version=2 \ --speculative-config '{"method":"mtp","num_speculative_tokens":1}'参数含义:
--tensor-parallel-size 4:张量并行度 4,与--gpus '"device=0,1,2,3"'指定的 4 张 GPU 对应;--max-model-len auto:按可用显存自动推导最大序列长度;--attention-backend FLASH_ATTN --attention-config.flash_attn_version=2:使用 FlashAttention v2 作为注意力后端;--speculative-config '{"method":"mtp","num_speculative_tokens":1}':启用基于模型内置MTP 模块(1 层)的投机解码,每次猜测 1 个后续 Token,可显著降低解码延迟。
重启已停止的容器(保留缓存)
docker start -a alice-vllm若想使用全部可用 GPU,将--gpus '"device=0,1,2,3"'替换为--gpus all,并相应调整--tensor-parallel-size。
发送推理请求
curl http://127.0.0.1:8001/v1/completions \ -H 'Content-Type: application/json' \ -d '{ "model": "yandex/AliceAI-Foundation-80B-A3B-Base", "prompt": "There are 256 coins of different weights. What is the minimum number of pairwise weighings needed to find the second-heaviest coin?", "max_tokens": 32768, "temperature": 0 }'服务默认监听容器内 8000 端口,已映射到宿主机 8001 端口(-p 8001:8000),因此请求发往127.0.0.1:8001。
Tokenizer 与特殊标记
Tokenizer 以LlamaTokenizer从 tokenizer.model 加载,使用SentencePiece BPE分词。从 tokenizer_config.json 可以看到:
tokenizer_class: "LlamaTokenizer",BOS 为<s>(id 1),EOS 为</s>(id 2),UNK 为<unk>;add_bos_token: true、add_eos_token: false;legacy: false:官方明确要求保持legacy: false以保留预期的空白处理行为,切勿改回true,否则分词结果会与预训练不一致。
特别地,[COT_ENABLE]、[COT_START]、[COT_END]以及工具使用(tool-use)标记都属于普通的原子词表 Token,而非 Hugging Face 的 special token,因此它们在推理中作为普通文本出现,不会被 tokenizer 特殊处理。
微调指南一:数据格式与 Chat Template
OpenAI Messages 格式与轨迹表示
模型预训练阶段使用的 agentic(智能体)数据采用标准 OpenAI Messages 格式:一条轨迹(trajectory)由一串消息构成,角色包括:
system:系统提示;user:用户输入;assistant:助手回复(可含推理轨迹与工具调用);tool:工具执行结果;meta:元信息。
而可用工具的定义通过独立的tools字段传递,不属于消息序列。
渲染模板 finetune/chat_template.jinja
在分词之前,每条轨迹都用仓库内的 finetune/chat_template.jinja 渲染成文本。该模板定义了角色前缀(system:/user:/assistant:/meta:)、推理轨迹与工具描述/函数调用/工具结果的文本表示——这正是模型在训练中实际见到的文本形态。模板关键机制:
- 角色前缀映射与
[COT_START]/[COT_END]包裹reasoning_content(推理轨迹),见模板的render_assistant宏; - 工具调用以
[TOOL_CALL_START]+ 函数名 + JSON 参数的形式展开,参数 JSON 通过tojson并转义& < > ' /等字符,见js宏与render_tool_calls宏; - 工具定义以
function {"name":...,"description":...,"parameters":...}的紧凑 JSON 行渲染,可选的return_parameters与few_shot_examples字段也会被序列化,见tool_definition宏; - 工具列表前缀为固定的俄语提示
Тебе доступны следующие функции:(“你可以使用以下函数”),这与模型预训练语料的语言分布一致; - 支持
add_generation_prompt开关:置为 true 时在末尾追加assistant:前缀用于推理续写。
重要:官方有意不将该模板设置为 tokenizer_config.json 中的chat_template——因为 Alice-AI-Foundation-80B-A3B-Base 是基础模型,没有唯一的对话格式应在推理时自动套用。该模板专用于微调数据的准备。
推荐做法
对于 SFT 与 RL 阶段,官方推荐将数据以 OpenAI Messages 格式存储,并用该模板渲染,从而保证新数据与模型预训练所见格式一致。
微调指南二:LoRA 微调实战(FSDP2 + 4×80GB GPU)
仓库提供了最小化 PEFT 微调示例 finetune/finetune_lora.py:加载固定 revision 的tatsu-lab/alpaca数据集,只对回复(response)部分计算训练损失,最终仅保存 LoRA 适配器。考虑到模型规模,该示例必须使用 FSDP2,官方设计为 4 张 80GB 显存的 GPU。
安装依赖
pip install \ transformers==5.16.1 \ accelerate==1.14.0 \ peft==0.20.0 \ datasets==5.0.1 \ flash-linear-attention==0.5.0 pip install flash-attn==2.8.1 --no-build-isolation启动训练
CUDA_VISIBLE_DEVICES=0,1,2,3 \ PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True \ accelerate launch \ --use_fsdp \ --num_processes 4 \ --num_machines 1 \ --dynamo_backend no \ --mixed_precision no \ --fsdp_version 2 \ --fsdp_reshard_after_forward true \ --fsdp_auto_wrap_policy TRANSFORMER_BASED_WRAP \ --fsdp_transformer_layer_cls_to_wrap AliceAIDecoderLayer \ --fsdp_cpu_ram_efficient_loading true \ --fsdp_sync_module_states true \ --fsdp_state_dict_type SHARDED_STATE_DICT \ finetune/finetune_lora.py \ --model yandex/AliceAI-Foundation-80B-A3B-Base \ --steps 100 \ --sequence-length 512 \ --output-dir alice-lora参数与脚本行为解读
对照 finetune/finetune_lora.py 源码,可进一步明确各参数的实际作用:
| 参数 | 默认值 | 说明 |
|---|---|---|
--model | 仓库本地路径 | 模型目录或 Hugging Face 模型 ID |
--steps | 1 | 训练步数(脚本要求为正整数) |
--sequence-length | 32 | 序列长度(至少 2;示例命令用 512) |
--learning-rate | 2e-4 | AdamW 学习率 |
--lora-rank | 8 | LoRA 秩;lora_alpha固定为2 * rank,lora_dropout=0,bias="none" |
--seed | 42 | 随机种子 |
源码层面的关键实现细节:
- LoRA 目标模块:
LORA_TARGET_MODULES = ["q_proj", "k_proj", "v_proj", "o_proj"],覆盖全注意力层的四个投影(KDA 层不注入 LoRA),任务类型为TaskType.CAUSAL_LM; - 数据编码:
encode_alpaca_row将 Alpaca 行组装为Instruction:\n...\n\nResponse:\n格式,回复长度上限MAX_RESPONSE_TOKENS=128(同时受sequence_length // 4约束),以 BOS 开头、EOS 结尾,labels中对 prompt 部分置-100(不计损失),padding 部分同时 mask 掉 attention; - 精度语义:
--mixed_precision no不代表 FP32 训练——基座权重以 BF16 加载,而 PEFT 将 LoRA 参数以 FP32 存储; - RAM 高效加载:开启
--fsdp_cpu_ram_efficient_loading后,只有 rank 0 进程加载完整 checkpoint 权重,其余进程在 meta device 上构建模型,再通过 FSDP2 接收各自的分片(load_model函数中通过torch.device("meta")建图); - 路由器缓冲处理:脚本会将各层的
e_score_correction_bias缓冲(MoE 路由偏差校正)先取出(remove_router_buffers),accelerator.prepare后再经广播恢复(restore_router_buffers),避免 FSDP 分片破坏该非训练缓冲; - RoPE 缓冲重建:
restore_rotary_buffer按head_dim × partial_rotary_factor计算旋转维度并重建inv_freq(基于rope_theta),确保 meta 设备上构建的模型位置编码正确; - 可训练参数物化:
materialize_trainable_parameters为 meta 设备上的 LoRA 参数分配真实存储(Accelerate 1.14 的 FSDP2 优化器按data_ptr()映射参数,meta 张量指针均为 0 会冲突); - 训练中启用梯度检查点(
use_reentrant=False),model.config.use_cache = False以省显存; - 训练结束后
save_adapter只保存 LoRA 适配器与 tokenizer 到--output-dir(分片 DTensor 先full_tensor()聚合再保存)。
训练过程的每步 loss 会以step=N loss=...打印,可作为冒烟测试的通过依据;脚本以LoRA fine-tuning smoke test completed结束。
仓库结构与延伸阅读
当前仓库即模型权重与配套代码的发布形态,关键文件:
- README.md:俄语版说明(与本文对应的英文版为 README_en.md);
- config.json 与 configuration_alice_ai.py:模型配置与自定义
AliceAIConfig; - modeling_alice_ai.py:完整自定义实现(
AliceAIForCausalLM、AliceAIKDA、AliceAIMoE、AliceAIModel等); - model.safetensors.index.json:49 个权重分片的索引与逐张量映射,总量约 162.57 GB(BF16);
- tokenizer.model、tokenizer_config.json、special_tokens_map.json:SentencePiece BPE 词表与分词配置;
- finetune/chat_template.jinja、finetune/finetune_lora.py:微调数据渲染模板与 LoRA 示例脚本;
- assets/benchmarks.png:基准对比图。
使用前提与限制:模型为 Apache-2.0 许可的基础模型,推理与微调均需依赖trust_remote_code加载自定义代码;KDA 层在 GPU 上依赖带 KDA 支持的flash-linear-attention(Transformers 路径)或官方 vLLM 镜像(yamlbrand/alice-ai-vllm);完整权重的加载与微调对显存(建议多卡 + FSDP2/张量并行)有较高要求,请根据实际硬件评估--tensor-parallel-size与--fsdp_cpu_ram_efficient_loading等配置。
- 人工智能
- 大模型
- 基础模型
- 预训练
【免费下载链接】AliceAI-Foundation-80B-A3B-Base
相关推荐
长上下文为什么这么省?AliceAI-Foundation-80B-A3B-Base混合线性注意力架构(KDA+Gated Attention)深度解析
长上下文为什么这么省?AliceAI Foundation 80B A3B Base混合线性注意力架构(KDA+Gated Attention)深度解析 Ali
人工智能大模型基础模型预训练512个专家如何调度?深拆AliceAI-Foundation-80B-A3B-Base的MoE架构:TopK路由+共享专家代码级解读
512个专家如何调度?深拆AliceAI Foundation 80B A3B Base的MoE架构:TopK路由+共享专家代码级解读 AliceAI Foun
人工智能大模型基础模型预训练Sigmoid TopK路由与专家偏差校正:读懂AliceAI-Foundation-80B-A3B-Base的MoE负载均衡机制
Sigmoid TopK路由与专家偏差校正:读懂AliceAI Foundation 80B A3B Base的MoE负载均衡机制 AliceAI Founda
人工智能大模型基础模型预训练
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考