字节大模型Agent 算法一面
字节大模型Agent 算法一面
元数据
- 作者:Offer面试官
- 分类:面经
- 抓取时间:2026-07-25T10:16:10Z
- 原文:[打开小红书笔记](https://www.xiaohongshu.com/search_result/69bfb28a000000001e00fbd3
- 互动:307 / 599 / 评论
正文
请介绍 Transformer 的结构组成及各部分作用。
如何降低 Transformer 的计算复杂度?常见的稀疏注意力变体有哪些?
LoRA 微调的原理是什么?秩 r 的选择会对模型表现产生什么影响?
KV Cache 是什么?为什么能提升推理速度?
RAG 的完整流程是怎样的?
微调时的训练数据是怎么构建的?如何保证样本多样性和质量?
在 RAG + 知识图谱的 Agent 系统中,知识图谱更新机制是怎样的?
在高并发查询的 Agent 系统中,你会如何优化召回和生成阶段的延迟?
训练 LoRA 模型时,你是如何选择冻结层的?依据是什么?
大规模 Agent 系统在多线程场景下,资源调度策略如何设计?
#八股 #校招 #面试技巧 #面试题 #大模型面试 #面经 #大模型 #字节大模型 #春招火热进行中
#八股 #校招 #面试技巧 #面试题 #大模型面试 #面经 #大模型 #字节大模型 #春招火热进行中
长图内容(视觉重读)
由 AI 视觉重读截图整理,替代原 tesseract OCR 乱码。图 p02–p04、p01 为完整题目卡片,比正文多出岗位信息和每题的追问链,按图中分类整理如下。
岗位信息:岗位名称 大模型 Agent 算法;面试时长 1h;博主自评分 7.5/10;是否下一轮:待通知。
Transformer 与模型基础
- 请介绍 Transformer 的结构组成及各部分作用。
- (追问)Self-Attention 和 FFN 分别在模型中承担什么角色?
- (追问)如果去掉 FFN,会对模型能力产生什么影响?
- 如何降低 Transformer 的计算复杂度?常见的稀疏注意力变体有哪些?
- (追问)不同稀疏注意力方案适用场景有啥区别?
- (追问)在长文本场景中优先选择哪种优化方式?
模型优化与推理加速
- LoRA 微调的原理是什么?秩 r 的选择会对模型表现产生什么影响?
- (追问)r 过大或过小分别会带来什么问题?
- (追问)LoRA 和全量微调在效果和成本上的差异是什么?
- KV Cache 是什么?为什么能提升推理速度?
- (追问)KV Cache 在多轮对话中如何复用?
- (追问)会带来哪些额外的内存开销?
RAG 与数据构建
- RAG 的完整流程是怎样的?
- (追问)向量检索库构建时,如何处理时间衰减对召回的影响?
- (追问)如果召回结果不准确优先优化哪部分?
- 微调时的训练数据是怎么构建的?如何保证样本多样性和质量?
- (追问)数据清洗和去重一般怎么做?
- (追问)如何判断数据是否对模型有正向提升?
Agent 与系统设计
- 在 RAG + 知识图谱的 Agent 系统中,知识图谱更新机制是怎样的?
- (追问)如何保证知识更新的实时性?
- (追问)如果数据存在冲突,你会怎么处理?
- 在高并发查询的 Agent 系统中,你会如何优化召回和生成阶段的延迟?
- (追问)召回和生成阶段哪个更容易成为瓶颈?
- (追问)如何做缓存或分级处理来降低延迟?
训练策略与工程实践
- 训练 LoRA 模型时,你是如何选择冻结层的?依据是什么?
- (追问)不同层对任务的影响有什么差异?
- (追问)有没有做过对比实验来验证?
- 大规模 Agent 系统在多线程场景下,资源调度策略如何设计?
- (追问)如何避免资源竞争或死锁问题?
- (追问)GPU/CPU 混合场景下如何分配任务?
图片




评论摘录
未抓到评论或评论区为空