【免费下载链接】ai-engineering-interview-questions-company-wise
Your Cheat Sheet For AI Engineering Interviews at Top AI Companies - Questions and Answers.
如果你正在准备 AI 工程岗位面试,ai-engineering-interview-questions-company-wise是一个值得收藏的开源项目——它汇总了 35 家头部 AI 公司(OpenAI、Anthropic、DeepSeek、Moonshot、Mistral 等)真实出现过的 AI 工程面试题,按公司维度组织,并尽可能附上答案入口。这篇大模型原理篇带你聚焦其中最高频的一块:Transformer 架构面试题,重点拆解 MQA、GQA、MLA 与 MoE 四大核心考点,帮你用最短时间建立答题框架。
🎯 为什么面试官反复追问 Transformer 架构?
翻开项目的 README.md,你会发现"LLM Internals and Architecture"是横跨几乎所有公司的通用考点专区(README.md#L116-L161)。从 OpenAI 的 self-attention 复杂度追问,到 Anthropic 的"张量级走一遍 decoder-only 前向传播",架构题几乎必问。
而其中出现频率最高、最容易拉开差距的四个关键词就是:
| 关键词 | 一句话定位 | 高频提问公司 |
|---|---|---|
| KV Cache | 解码阶段的显存账本 | OpenAI、xAI、Apple、NVIDIA |
| MQA / GQA | 压缩 KV Cache 的注意力改造 | Meta、Mistral AI |
| MLA | DeepSeek 系的低秩 KV 压缩 | DeepSeek、Moonshot AI |
| MoE | 稀疏激活扩展模型容量 | Mistral、DeepSeek、GLM、Qwen |
💡 备考建议:先通读 通用高频题专区,再按目标公司定位章节,这是 README.md#L103-L110 中官方推荐的用法。
⚡ MQA 与 GQA:把 KV Cache 成本打下来
面试官原題(出自 Meta、Mistral AI):
What are Multi-Query Attention (MQA) and Grouped-Query Attention (GQA), and what do they trade away? ——见 README.md#L123-L125
30 秒建立直觉
自回归生成每多一个 token,都要把新的 Key/Value 存进 KV Cache,显存随上下文长度线性膨胀。三种方案的取舍一目了然:
| 方案 | K/V 头数 | KV Cache 大小 | 质量 |
|---|---|---|---|
| MHA(标准多头注意力) | 与 Q 头数相同 | 最大 | 最好 |
| MQA(多查询) | 全局共享 1 组 | 最小 | 略有损失 |
| GQA(分组查询) | 分成 G 组,组内共享 | 介于两者之间 | 接近 MHA |
答题要点:MQA 用极致的显存压缩换质量,GQA 则在两者之间做平滑折中——这也是为什么 Llama 2 70B 起、Mistral 7B 全系都采用 GQA。
延伸真题(务必提前想好)
- Meta 架构追问:为什么 Llama 类模型选 GQA + RoPE + SwiGLU 而不是 2017 原版 Transformer?(README.md#L676-L677)
- Mistral 7B 双特性题:GQA 和滑动窗口注意力各自买到什么、付出什么代价?(README.md#L771-L772)
- 手撕代码高频题:实现多头注意力,然后把它改造成 GQA——Google DeepMind、Mistral、Qwen 都考过(README.md#L414-L416)
🧠 MLA:DeepSeek 的多头潜在注意力
面试官原題(出自 DeepSeek、Moonshot AI):
What is Multi-head Latent Attention (MLA) and why did DeepSeek introduce it? ——见 README.md#L126-L128
核心思路
MLA 不再逐头保存 K/V,而是先把 K/V压缩成一个低秩潜在向量,推理时再从潜在向量解压。相当于给 KV Cache 做了"无损感"的降维压缩,在保持接近 MHA 质量的同时,显存占用比 GQA 更激进地下降。
加分回答:把 MLA 放进"KV Cache 压缩技术谱系"里讲——MQA/GQA 是共享式压缩,MLA 是低秩投影式压缩,两者都服务于同一个目标:让长上下文推理的显存账单可承受。
📌 真实考题对照:Kimi K2 用的正是 MLA,Moonshot 的面试官会直接问它与 GQA 相比的 KV 压缩优势(README.md#L886-L887);而 xAI、NVIDIA 等公司则喜欢追问"70B 模型 128K 上下文的 KV Cache 显存估算"(README.md#L739-L740),建议把公式推导练到脱口而出。
🧩 MoE:参数翻倍、算力不翻倍的秘诀
面试官原題(Mistral、Cohere、DeepSeek、Moonshot、GLM、Qwen 均考):
What is a mixture-of-experts architecture and how does it scale capacity without scaling FLOPs? ——见 README.md#L142-L144
一句话机制
每个 token 经过 Router 打分后,只激活 Top-k 个专家(通常是 k=2)。于是:
- 总参数量决定模型"记住了多少知识"(容量)
- 激活参数量决定每个 token 的实际计算开销
项目仓库中的真实案例速览
| 公司 | 模型 | 总参数 | 激活参数 | 出处 |
|---|---|---|---|---|
| Mistral AI | Mixtral 风格 MoE | ~47B | ~13B | README.md#L773-L774 |
| Zhipu AI | GLM-4.5 | 355B | 32B | README.md#L927-L928 |
| Alibaba | Qwen MoE | 30B-A3B / 235B-A22B | 3B / 22B | README.md#L975-L976 |
| Moonshot AI | Kimi K2 | 1T | ~32B | README.md#L888-L889 |
| DeepSeek | DeepSeekMoE | 671B 级别 | 稀疏激活 | README.md#L849-L855 |
三个必会的追问方向
- 负载均衡:DeepSeek 追问"无辅助损失(aux-loss-free)的 bias 技巧为什么能替代辅助损失"(README.md#L851-L852)
- 手撕 Router:用 PyTorch 实现 Top-k 路由并指出效率陷阱——DeepSeek、GLM 都考过(README.md#L854-L855、README.md#L929-L930)
- 工程经济学:Cohere 会问"MoE 为什么适合企业私有化部署、痛在哪里"(README.md#L811-L812)——提示:激活参数少→推理便宜,但总参数大→显存和专家并行是难点
📋 大模型原理题速查清单
| 考点 | 一句话答案骨架 | 仓库出处 |
|---|---|---|
| KV Cache 公式推导 | 每 token 每层存 2×d_kv,随序列长度线性增长 | README.md#L120-L122 |
| MHA→GQA 改造 | 组内共享 K/V 头,Cache 降为 1/G | README.md#L414-L416 |
| MLA 动机 | 低秩压缩 KV,长上下文显存友好 | README.md#L126-L128 |
| MoE 容量/算力解耦 | Top-k 路由,总参数扩容量、激活参数定开销 | README.md#L142-L144 |
| 位置编码演进 | 正弦 → 可学习 → RoPE → ALiBi,再谈 YaRN 扩上下文 | README.md#L135-L139 |
| SwiGLU 门控激活 | 为什么替代 ReLU/GELU(Meta 考过) | README.md#L156-L158 |
🚀 三步把这份题库用出效果
第 1 步:克隆仓库
git clone https://gitcode.com/gh_mirrors/ai/ai-engineering-interview-questions-company-wise第 2 步:先打通用题地基。按 How to use this 的建议,把 Common Questions 过一遍——每道题都标注了"哪些公司问过",一张表覆盖 35 家的 80% 考点。
第 3 步:按目标公司精读。例如投 DeepSeek 就重点啃 DeepSeek 章节(DeepSeekMoE、辅助损失、FP8 训练、MTP),投 Moonshot 则主攻 长上下文与 MLA。每家公司都写清了面试轮次结构,方便你安排模拟节奏。
💡 小贴士:仓库的题与答案持续更新,建议把 README.md 加入收藏,面试前一周重刷一遍"LLM Internals and Architecture"专区即可保持手感。
写在最后:Transformer 架构题的考察重心已经从"背结构图"转向"讲权衡"——MQA 牺牲什么换来什么、MLA 为什么比 GQA 更进一步、MoE 的账怎么算。把本文的对比表和仓库真题结合起来练,你会在面试官追问的第二层、第三层依然游刃有余。
【免费下载链接】ai-engineering-interview-questions-company-wise
Your Cheat Sheet For AI Engineering Interviews at Top AI Companies - Questions and Answers.
相关推荐
OpenMythos 架构指南:从 Recurrent-Depth Transformer 理论到 MLA/GQA 与 MoE 的完整实现
OpenMythos 架构指南:从 Recurrent Depth Transformer 理论到 MLA/GQA 与 MoE 的完整实现 本文以 OpenMy
人工智能大模型深度学习预训练Mistral AI Transformer层深度解析:MoE架构的高效实现原理与实战指南
Mistral AI Transformer层深度解析:MoE架构的高效实现原理与实战指南 Mistral AI作为开源大语言模型领域的领军者,其 Transf
人工智能大模型模型推理服务本地部署yuzu 模拟器使用教程:从零到第一次跑通的完整设置
yuzu 模拟器使用教程:从零到第一次跑通的完整设置 6 英寸小屏、3 小时续航、出门还得带底座——想认真玩 Switch 游戏的人,迟早会把这套东西搬回电脑。
虚拟化图形学逆向工程
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考