跳到主要内容
面试之前,先来面栈
搜索
题库
/
模型训练与对齐
强化学习与奖励
9
个专题 ·
270
道题
专题概览
题目列表
270
强化学习与奖励
继续复习
→
待复习
0
问题类型
问题类型
比较选型
代码题
方案设计
概念解释
故障排查
项目深挖
原理机制
问题类型
技术难度
技术难度
基础
进阶
深入
技术难度
复习状态
复习状态
未标记
待复习
已掌握
复习状态
已筛选
清除筛选
共
100
道题
开始复习 →
排序:
排序
相关面经最多
题集收录最多
题号顺序
最新更新
题号
题目
技术难度
收录情况
复习状态
1232
行为风格如何输入智能体,输入是连续值还是离散值?
模型训练与对齐
强化学习与奖励
原理机制
已有答案
面前必看
进阶
1
篇面经
行为风格如何输入智能体,输入是连续值还是离散值?的复习状态
未标记
待复习
已掌握
›
1233
如何证明模型学到了不同风格的影响,并评估效果?
模型训练与对齐
强化学习与奖励
方案设计
已有答案
面前必看
进阶
1
篇面经
如何证明模型学到了不同风格的影响,并评估效果?的复习状态
未标记
待复习
已掌握
›
1234
PPO 与 TRPO 有何区别?
模型训练与对齐
强化学习与奖励
比较选型
已有答案
面前必看
进阶
1
篇面经
PPO 与 TRPO 有何区别?的复习状态
未标记
待复习
已掌握
›
1235
训练中出现策略坍缩如何解决?
模型训练与对齐
强化学习与奖励
故障排查
已有答案
面前必看
进阶
1
篇面经
训练中出现策略坍缩如何解决?的复习状态
未标记
待复习
已掌握
›
1236
如何体现和评估策略鲁棒性?
模型训练与对齐
强化学习与奖励
方案设计
已有答案
面前必看
进阶
1
篇面经
如何体现和评估策略鲁棒性?的复习状态
未标记
待复习
已掌握
›
1614
对齐后正常问题也过度拒答,应优先修正什么?
模型训练与对齐
强化学习与奖励
故障排查
已有答案
面前必看
进阶
1
篇面经
对齐后正常问题也过度拒答,应优先修正什么?的复习状态
未标记
待复习
已掌握
›
1730
项目的 SFT 和 GRPO 是否分为两个阶段?
模型训练与对齐
强化学习与奖励
项目深挖
已有答案
面前必看
进阶
1
篇面经
项目的 SFT 和 GRPO 是否分为两个阶段?的复习状态
未标记
待复习
已掌握
›
1733
强化学习项目的决策和动作空间是离散的吗?
模型训练与对齐
强化学习与奖励
项目深挖
已有答案
面前必看
进阶
1
篇面经
强化学习项目的决策和动作空间是离散的吗?的复习状态
未标记
待复习
已掌握
›
1734
当前动作空间不够细致时,如何解释这种粒度设计?
模型训练与对齐
强化学习与奖励
项目深挖
已有答案
面前必看
深入
1
篇面经
当前动作空间不够细致时,如何解释这种粒度设计?的复习状态
未标记
待复习
已掌握
›
1735
决策项目采用多智能体协同有哪些优势和难点?
模型训练与对齐
强化学习与奖励
项目深挖
已有答案
面前必看
进阶
1
篇面经
决策项目采用多智能体协同有哪些优势和难点?的复习状态
未标记
待复习
已掌握
›
1232
行为风格如何输入智能体,输入是连续值还是离散值?
模型训练与对齐
强化学习与奖励
原理机制
已有答案
面前必看
进阶
1
篇面经
行为风格如何输入智能体,输入是连续值还是离散值?的复习状态
未标记
待复习
已掌握
›
未找到相关题目
换个关键词,或清除筛选。
清除筛选
共
100
道题 · 显示 31–40 道
上一页
1
…
3
4
5
…
10
4 / 10
下一页
启用 JavaScript 后可筛选和浏览完整题库;当前显示前 10 道题。