跳到主要内容
面试之前,先来面栈
搜索
题库
/
模型训练与对齐
模型训练与对齐
9
个专题 ·
270
道题
专题概览
题目列表
270
模型训练与对齐面试题
继续复习
→
待复习
0
知识专题
知识专题
参数高效微调
分布式训练与计算硬件
偏好对齐
强化学习与奖励
训练框架、调参与排障
训练数据构建与治理
预训练、续训与 SFT
蒸馏与模型合并
Verifier 与训练评测
知识专题
知识专题
找到
9
个专题
知识专题
✓
参数高效微调
✓
分布式训练与计算硬件
✓
偏好对齐
✓
强化学习与奖励
✓
训练框架、调参与排障
✓
训练数据构建与治理
✓
预训练、续训与 SFT
✓
蒸馏与模型合并
✓
Verifier 与训练评测
✓
未找到匹配专题
问题类型
问题类型
比较选型
代码题
方案设计
概念解释
故障排查
经历介绍
开放讨论
系统设计
项目深挖
效果评估
原理机制
问题类型
技术难度
技术难度
基础
进阶
深入
技术难度
复习状态
复习状态
未标记
待复习
已掌握
复习状态
已筛选
清除筛选
共
270
道题
开始复习 →
排序:
排序
相关面经最多
题集收录最多
题号顺序
最新更新
题号
题目
技术难度
收录情况
复习状态
2772
GRPO 生成只命中商品 SID 前两个 Token 时如何给奖励?
模型训练与对齐
强化学习与奖励
方案设计
已有答案
面前必看
进阶
暂无面经
GRPO 生成只命中商品 SID 前两个 Token 时如何给奖励?的复习状态
未标记
待复习
已掌握
›
2789
过程监督信号如何设计,还能用于哪些任务?
模型训练与对齐
预训练、续训与 SFT
方案设计
已有答案
面前必看
进阶
暂无面经
过程监督信号如何设计,还能用于哪些任务?的复习状态
未标记
待复习
已掌握
›
2790
如何平衡强化学习训练效率与稳定性?
模型训练与对齐
强化学习与奖励
方案设计
已有答案
面前必看
进阶
暂无面经
如何平衡强化学习训练效率与稳定性?的复习状态
未标记
待复习
已掌握
›
2792
大模型还有哪些值得增强的能力?
模型训练与对齐
预训练、续训与 SFT
开放讨论
已有答案
面前必看
—
暂无面经
大模型还有哪些值得增强的能力?的复习状态
未标记
待复习
已掌握
›
2794
小模型做强化学习是否有效,如何选择模型与每轮数据规模?
模型训练与对齐
强化学习与奖励
比较选型
已有答案
面前必看
进阶
暂无面经
小模型做强化学习是否有效,如何选择模型与每轮数据规模?的复习状态
未标记
待复习
已掌握
›
2796
论文方法能否泛化到垂直领域?
模型训练与对齐
Verifier 与训练评测
效果评估
已有答案
面前必看
进阶
暂无面经
论文方法能否泛化到垂直领域?的复习状态
未标记
待复习
已掌握
›
2834
GRPO 训练数据应满足哪些要求?
模型训练与对齐
强化学习与奖励
方案设计
已有答案
面前必看
进阶
暂无面经
GRPO 训练数据应满足哪些要求?的复习状态
未标记
待复习
已掌握
›
2837
显存受限时如何选择模型训练方案?
模型训练与对齐
分布式训练与计算硬件
方案设计
已有答案
面前必看
进阶
暂无面经
显存受限时如何选择模型训练方案?的复习状态
未标记
待复习
已掌握
›
2848
A2C 的基本原理是什么?
模型训练与对齐
强化学习与奖励
原理机制
已有答案
面前必看
进阶
暂无面经
A2C 的基本原理是什么?的复习状态
未标记
待复习
已掌握
›
2899
DPO 训练有哪些需要注意的事项?
模型训练与对齐
偏好对齐
方案设计
已有答案
面前必看
进阶
暂无面经
DPO 训练有哪些需要注意的事项?的复习状态
未标记
待复习
已掌握
›
2772
GRPO 生成只命中商品 SID 前两个 Token 时如何给奖励?
模型训练与对齐
强化学习与奖励
方案设计
已有答案
面前必看
进阶
暂无面经
GRPO 生成只命中商品 SID 前两个 Token 时如何给奖励?的复习状态
未标记
待复习
已掌握
›
未找到相关题目
换个关键词,或清除筛选。
清除筛选
共
270
道题 · 显示 191–200 道
上一页
1
…
19
20
21
…
27
20 / 27
下一页
启用 JavaScript 后可筛选和浏览完整题库;当前显示前 10 道题。