众力资讯网

二面面经(一共三轮技术面)

这一轮的面试官比上一轮温和不少,不过专业性依旧,微软的三轮面试面试官都很不错,尊重面试者,能看的出这个组组内氛围和技术氛围很不错。
1.简单自我介绍,并说明你更想做训练还是推理,为什么?
投机解码:
2.基于 DeepSpec 适配 EAGLE3、DSpark、DFlash 的完整流程是什么?能否写一段伪代码描述三者的全过程?
3.TeleChat 模型在做 Speculative Decoding 适配时,Hidden State 是怎么收集的、具体取哪些层?MLA / KV Cache 又是怎么适配的?
4.Speculative Decoding 中 Acceptance Rate 是怎么定义和统计的?除了 Acceptance Rate,还关注哪些指标?
5.Draft Model 是什么结构?训练数据怎么构造,Hidden State 怎么作为监督信号,Loss 又是怎么设计的?
6.EAGLE3、DSpark、DFlash 三种方法最终的实验结果怎么样?Acceptance Rate、平均接受长度和端到端吞吐分别有什么差异,为什么最终结果和 Paper 可能不一致?
量化部分:
1.你的 FP8 Block Quantization 是怎么从 AWQ 思路扩展来的?相比原始 AWQ,具体做了哪些修改?
2.量化后的端到端性能为什么只有 1.2~1.3×,没有达到理论上的接近 2×?KV Cache、Attention、Routing、TP=2 等因素分别有什么影响?
3.你的 FP8 具体量化了哪些模块,哪些模块保留 BF16?为什么 Embedding、LM Head、Router、Attention 等模块需要保留?
4.你了解这个模型的 MoE 是怎么计算的吗?从 Router 选择 Top-K Expert,到一个 Batch 中多个 Token 分配给多个 Expert,再到单卡上多个 Expert 的实际计算过程,具体是怎么实现的?
算子部分:
1.你做的 Sparse Attention 整体计算流程是什么?为什么需要自己实现这些 Kernel?
2.你这个 Sparse Attention 算子的 16.9× 加速是相对什么 Baseline?当时主要解决了昇腾算子在什么维度 / Group 上的适配限制?
类八股:
你对 vLLM、SGLang、TensorRT-LLM 的了解和使用情况怎么样?新模型一般怎么接入推理框架,不同框架在性能和适用场景上有什么区别?
可以用CUDA 手写 Kernel吗?
表示不能后手撕LeetCode 95 不同的二叉搜索树 II#找实习 #面经 #微软 #推理加速