大模型算法工程师面经
完整信息
本篇目录
攒攒人品!有面试过同岗的朋友欢迎评论区交流
1.项目拷打
2.实习提问:
项目的背景
sft和rl的数据构造
构造的时候是点对点还是点对面类型的构造?
为什么要用rl来优化模型,在sft的时候遇到了哪些问题,又是怎么解决的?
RL的时候奖励函数是如何设计的?最终效果怎么样?
3.项目提问:
它的记忆管理是如何做的?
为什么要用多agent来做?
多个agent之间是如何进行信息交互的?
4.算法手撕:无
本篇目录
- 01
项目的背景
- 02
sft和rl的数据构造 构造的时候是点对点还是点对面类型的构造?
- 03
为什么要用rl来优化模型,在sft的时候遇到了哪些问题,又是怎么解决的?
- 04
RL的时候奖励函数是如何设计的?最终效果怎么样?
- 05
它的记忆管理是如何做的?
- 06
为什么要用多agent来做?
- 07
多个agent之间是如何进行信息交互的?
上一问 ↑