作业帮

4 篇面经53 道面试题

已筛选

53 道题

排序:

2697
SFT、DPO、PPO 与 GRPO 的目标、机制和适用条件如何比较?
模型训练与对齐强化学习与奖励
比较选型
进阶
2721
代码 Agent 为什么能有效完成开发任务?
Agent 原理与系统Agent 基础与运行循环
原理机制
进阶
2876
Qwen3.5 的架构是什么?
模型基础与推理模型架构与表示
原理机制
进阶