字节跳动

66 篇面经690 道面试题

已筛选

690 道题

排序:

3369
奖励什么时候使用模型,什么时候使用规则?
模型训练与对齐强化学习与奖励
比较选型
进阶
3370
如何避免奖励坍缩和 Reward Hacking?
模型训练与对齐强化学习与奖励
故障排查
进阶
3371
有哪些工程方法处理较长的问答?
Agent 原理与系统上下文工程
方案设计
进阶
3372
多轮对话如何微调?
模型训练与对齐预训练、续训与 SFT
原理机制
进阶
3373
Agentic RL 如何设计?
模型训练与对齐强化学习与奖励
方案设计
进阶
3374
如何评估 Agentic RL 的效果?
AI 应用工程与治理评测体系与实验设计
效果评估
进阶
3396
Agent 的长短期记忆如何提取?
Agent 原理与系统记忆系统
项目深挖
进阶
3397
检测到用户极端情绪时,Agent 如何在不中断对话流的前提下干预?
Agent 原理与系统Agent 应用架构与场景设计
方案设计
深入
3398
稠密向量与稀疏向量有什么区别,分别适合哪些搜索需求?
RAG 与知识系统Embedding 与向量表示
比较选型
基础
3399
长文档为什么要在向量化前切片,不切片有什么后果?
RAG 与知识系统文档切分与元数据
原理机制
基础

另有 1 篇多公司合集,可在面经记录中查看。