当前位置:
AIGC文章详情

秋招冲刺,大模型推理八股哪些必考、哪些陪跑:替你整理好了

源自92位全网作者

08-21 16:40

金九银十就在眼前,最近聊大模型面试的明显多了起来。问得最多的一个问题是:推理这块的八股,到底要不要背、背多少?

这个问题特别真实。打开任何一个平台,都有人甩给你一份"大模型推理八股100题",从 Prefill 讲到投机解码,看着就头大。更扎心的是,辛辛苦苦背了一周,面试被追问一句"LLaMA-7B 推理大概要多少显存,你是怎么估的",直接卡壳——因为那份100题里,压根没教你怎么把知识点串成一条线。

先说句实在话:2026 年的大模型面试,纯八股的权重确实在降。知乎好几份今年的面经里,面试官零八股、全程高强度拷打项目。微信公众号但这不代表推理八股可以躺平不准备——恰恰相反,有几道硬题几乎绕不开,而且它们现在不只考 infra 岗,连算法岗、后训练岗都会被问到。有过来人提醒,八股虽然问得少了,但绝对不可以不准备,因为已经"好几次挂在这上面"。

所以真正的问题不是"背不背",而是"背哪些、怎么背才不白背"。我把小红书、知乎、公众号上一堆今年的面经和八股整理翻了一遍,帮你把推理这块拆成一张分级地图:哪些是必考硬题,哪些是加分项,哪些听着唬人其实性价比低,还有几个一答就露怯的错误说法。

在分级之前,先给你一根主线。这根线是推理八股的"任督二脉",想通了它,后面一半的题你根本不用背,能自己推出来。

大模型推理分两个阶段,瓶颈完全不同。

Prefill(预填充):你输入的那段 prompt,模型一次性并行处理完。这个阶段是算力瓶颈(compute-bound),拼的是 GPU 算得快不快。

Decode(解码):模型一个字一个字往外蹦。每生成一个 token,都要把整个模型的权重从显存里完整读一遍,但每个 token 的实际计算量很小。这个阶段是带宽/显存瓶颈(memory-bound),拼的是显存读得快不快、装不装得下。

记住这一句:推理优化的所有八股,本质都在干两件事之一——要么让 Prefill 算得更快,要么让 Decode 少搬数据、多装请求。后面每个技术,你都能往这根线上挂。

秋招冲刺,大模型推理八股哪些必考、哪些陪跑:替你整理好了

第一档:必考硬题,优先吃透

这几道是面经里反复出现的,属于"不会就真可能挂"的级别。

一、Prefill 和 Decode 的区别,各自瓶颈是什么。就是上面那根主线。答的时候先说两阶段,再点出 compute-bound 对 memory-bound,面试官基本就点头了。这是所有后续问题的地基。

二、KV Cache 是什么、为什么需要、怎么优化。Decode 每生成一个 token,都要用到之前所有 token 的 Key 和 Value。如果每次都重算,计算量爆炸。所以把算过的 KV 缓存下来,这就是 KV Cache。代价是它很吃显存——会随着序列长度和并发数增长。优化方向就是后面要讲的 PagedAttention、量化、offload。这题是推理八股的绝对核心,几乎必问。

三、怎么估算一个大模型的推理显存。这是今年面经里的高频硬题(比如"估算 LLaMA-7B 的推理显存")。小红书记住四块:模型权重 + KV Cache + 激活值 + 框架开销。快速估算时,权重约等于参数量乘以每参数字节数,FP16 是 2 字节、INT4 是 0.5 字节,所以 7B 模型的 FP16 权重大约 14GB。短上下文下权重是大头,可以粗略按"参数量 × 精度字节 × 1.2"预留;但长上下文、高并发时 KV Cache 会变成大头,得单独算。能说出这个分层思路,比背一个具体数字值钱得多。

秋招冲刺,大模型推理八股哪些必考、哪些陪跑:替你整理好了

四、量化(Quantization)。FP16、BF16、INT8、INT4 的区别,以及 GPTQ、AWQ、GGUF 这些方法。考点是"精度、显存、速度"三者的权衡。关键一句:量化不是免费午餐,但 INT4/AWQ 这类方法在多数场景精度损失很小,通常只有个位数百分比,却能把显存压到四分之一。

五、Continuous Batching(连续批处理)。对比传统的 Static Batching:静态批要等一批里最慢的那条生成完才能放新请求进来,GPU 大量空转;连续批处理允许请求随到随进、完成就走,大幅提升吞吐。这是现代推理引擎的标配。

六、常见推理框架及怎么选。至少说得出 vLLM(PagedAttention,通用高吞吐、生态最全)、SGLang(RadixAttention,多轮对话和前缀复用强)、TensorRT-LLM(N 卡性能天花板但要编译)、llama.cpp/Ollama(本地轻量)。知乎面试官常追问"vLLM 和 SGLang 怎么选",标准答案不是谁更快,而是看负载——前缀复用多、Agent 场景偏 SGLang,通用独立请求偏 vLLM。什么值得买

七、推理性能指标。TTFT(首 token 延迟)、TPOT 或 ITL(每个输出 token 的延迟)、吞吐(tokens/s)。能分清这三个,说明你真懂在线服务的体验指标,而不是只会背一个 throughput。

第二档:高频加分项,有余力就上

八、PagedAttention 原理:借鉴操作系统虚拟内存和分页,把 KV Cache 切成固定大小的块、允许不连续存放、用页表映射,解决显存碎片、提升利用率。这是 vLLM 的立身之本。

九、FlashAttention:IO-aware 的注意力实现,核心是减少对显存 HBM 的读写次数,用分块加重计算换访存。答出"它省的是访存,不是算力",是加分点。

十、投机解码(Speculative Decoding):用小模型快速"打草稿"生成多个 token,大模型一次性验证。因为验证是并行的,所以能加速 Decode。但一定要补一句:加速效果取决于接受率,接受率低时反而更慢。

十一、并行策略。TP 张量并行是把单层切到多卡,对卡间通信要求高,适合高速互联;PP 流水线并行按层切,跨机更友好;DP 数据并行;EP 专家并行是 MoE 专用。能说清各自适用场景就够了。

秋招冲刺,大模型推理八股哪些必考、哪些陪跑:替你整理好了

十二、MoE 与推理。稀疏激活,每次只用一小部分专家。有个易错点要说对:MoE 的显存需求由总参数量决定,因为所有专家权重都得装下;但计算量只由激活参数决定。所以它是"省算力、不省显存"。

十三、Chunked Prefill 和 PD 分离。把长 prefill 切块、和 decode 交错着跑,或者干脆把 Prefill 和 Decode 拆到不同机器上部署,都是为了缓解两阶段互相干扰、稳定延迟。偏 infra 的岗位爱问。

第三档:了解即可,别在这耗太多时间

Prefix Caching 的具体实现细节、KV Cache 量化和 offload 到 CPU、约束解码(JSON schema 输出)……这些知道概念、能说出它解决什么问题就够了,除非你面的岗位专门做这一块。

几个会坑你的错误答案,先打个预防针

这些是八股资料里常见、但一答就露怯的说法。

“推理是 memory-bound 的”——只对了一半。Decode 是,Prefill 是 compute-bound。说全了才严谨。

“量化一定会明显掉点”——不准确。INT4/AWQ 等成熟方法在多数任务上损失很小,否则量化不会成为标配。

“投机解码一定加速”——错。取决于草稿模型的接受率,接受率低时反而拖慢。

“显存就看模型参数”——漏了 KV Cache 和激活,长上下文、高并发下会错得离谱。

“vLLM 比 SGLang 快”——没有前提就不成立。谁快取决于你的负载前缀复用率高不高。

面试里这些点往往是追问的钩子,答对"但是"和"前提是",比背结论更显功底。

按你要面的岗位,调一下火力

算法岗、后训练岗:别以为不考推理。显存估算、KV Cache、bf16 和 fp16 的区别、推理框架选型这几道照样会问,把第一档吃透基本就够。

推理引擎、AI infra 岗:第二档全都要能展开,PagedAttention、投机解码、并行策略、PD 分离要讲到实现层面,最好再有一段动手部署或调优的经历兜底。

部署、运维偏工程岗:框架选型、量化、性能指标、OOM 排查这些实操向的,多准备。

秋招冲刺,大模型推理八股哪些必考、哪些陪跑:替你整理好了

最后说怎么用这张地图

时间紧的话,顺序是:先把主线(Prefill 算力瓶颈、Decode 带宽瓶颈)想透,再吃透第一档那七道硬题,有余力再扫第二档。每道硬题,按"先说结论、再挂主线、最后补细节和权衡"来组织答案,比流水账式背诵抗追问得多。

但也要给你泼点冷水,这也是今年面经的共识:八股只是入场券,不是通关文牒。越来越多团队零八股、直接高强度拷打项目——你做过什么、为什么这么选、踩过什么坑,比背得多不多更要命。所以八股省下来的时间,记得投给你的项目复盘和手撕代码。

这张地图大概率不用一次看完,先收着,按自己的目标岗位和时间倒着推。等你面完,欢迎回来评论区对答案——哪道题真考到了、哪个坑你真踩了,帮后面的人再省点时间。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章