第四范式一面
一、 vLLM 及相关推理优化高频技术深挖考察意图面试官不仅想听你用过更想听你懂原理。重点在于内存管理、连续批处理和吞吐量优化。【标准回答思路】核心原理必背重点阐述PagedAttention。类比操作系统虚拟内存管理传统KV Cache是连续存储浪费大vLLM将其拆分为固定大小的Block像分页一样动态映射极大减少了内存碎片和冗余复制。提及Continuous Batching连续批处理不同于静态批处理等待最慢的请求它能实时检测哪些请求已结束立即插入新请求显著提高GPU利用率。关键参数调优gpu_memory_utilization通常设为0.9~0.95预留显存给模型权重和激活值。max_num_seqs/max_num_batched_tokens控制并发数。如果OOM优先降低这两个值。tensor_parallel_size多卡推理时的张量并行度。swap_space当显存不足时将KV Cache换入换出到CPU内存速度慢但防止崩溃。如何进一步加速使用Quantization量化如AWQ/GPTQvLLM支持。CUDA Graph减少Python调用开销vLLM默认开启。硬件层面FlashAttention-2如果模型支持、Triton内核优化。二、 量化与微调基础概念与流程考察意图考察基本功是否扎实是否具备落地能力。不需要背诵公式但要讲清适用场景和流程。【标准回答思路】量化 (Quantization)概念将FP16/BF16的模型权重量化为INT8/INT4减少显存占用提升推理速度。常见方案GPTQ训练后量化单卡即可完成速度快精度损失可控常用。AWQ激活感知权重量化认为权重不全重要只保护重要权重通常比GPTQ精度更高。GGUF主要用于CPU或Apple Siliconllama.cpp生态。总结生产环境首选AWQ/GPTQ移动端选GGUF。微调 (Fine-tuning)概念让预训练模型适应下游任务。流程数据清洗 - Prompt格式化 - SFT监督微调- DPO/RLHF对齐。参数高效微调 (PEFT)重点提LoRA。原理冻结原模型权重注入低秩矩阵A和B进行训练参数量极少约1%显存占用低效果好。优势训练快支持多适配器切换Adapter部署灵活。三、 简历优化策略针对LLM方向考察意图证明你有处理真实数据、解决大模型相关问题的能力而非仅仅是调包侠。【修改建议】结构调整将 移至“项目经历”或“竞赛经历”的最前两项。简化其他无关竞赛如数学建模、ACM等保留一行简述即可腾出空间给LLM相关内容。内容侧重STAR法则重点描述你如何处理大规模日志数据、特征提取以及是否涉及异常检测这与LLM的安全围栏/Safety相关。改为“构建了基于RAG检索增强生成​ 的管道实现了向量召回Embedding与关键词召回BM25的混合检索。”强调向量数据库选型、Embedding模型微调、Re-ranking重排序策略、RecallK指标的提升。技能栈对齐在技能栏明确列出PyTorch,Transformers,LangChain/LlamaIndex,vLLM,DeepSpeed,QLoRA/AWQ。如果你做过评测加上OpenCompass或相关Eval指标。四、 面试软技能与沟通技巧考察意图考察抗压能力、逻辑表达能力及职业素养。【实战技巧】克服紧张 精简表达金字塔原理结论先行。例如问“如何优化推理”先答“我从显存管理和计算效率两个维度优化”再展开。控制时长单个问题的回答控制在1-2分钟。面试官打断你是常态说明他抓住了重点或者想追问。物理调节语速放慢沉稳呼吸。遇到不会的坦诚说“这方面了解不深但我猜测可能和XX有关”不要胡编乱造。反问环节Reverse Interview切忌不问也不要只问薪资福利。高质量问题储备“请问团队目前在LLM落地过程中遇到的最大技术挑战是什么如长上下文、推理成本还是幻觉问题”“目前业务使用的是自研模型还是开源模型后续的迭代路线是怎样的”“对于校招/实习新人团队更期待他在前三个月达成什么样的成果”针对技术官“您在这个岗位上工作觉得最有成就感的一个项目是什么”