模型训练与对齐

9 个专题 · 270 道题

已筛选

270 道题

排序:

1744
项目为什么没有采用 TD3?
模型训练与对齐强化学习与奖励
比较选型
进阶
1745
TD3 相比 DDPG 有哪些改进?
模型训练与对齐分布式训练与计算硬件
比较选型
进阶
1750
手写 PPO Loss。
模型训练与对齐强化学习与奖励
代码题
深入
1827
实习中的轨迹蒸馏具体如何实现?
模型训练与对齐蒸馏与模型合并
项目深挖
深入
1829
实习中的训练数据后处理和评审具体如何做?
模型训练与对齐训练数据构建与治理
项目深挖
进阶
1847
全量微调受到哪些具体资源限制,项目实际不足在哪里?
模型训练与对齐参数高效微调
项目深挖
深入
1848
LoRA 主要解决什么问题,节约哪些资源,为什么能节约?
模型训练与对齐参数高效微调
原理机制
进阶
1849
LoRA 的 Rank 参数是什么含义,增大会带来哪些问题?
模型训练与对齐参数高效微调
原理机制
进阶
1850
是否遇到 memory、data 或 CPU/GPU bound,发生在训练还是推理?
模型训练与对齐分布式训练与计算硬件
项目深挖
进阶
1853
模型训练或推理显存不足时有哪些优化方法?
模型训练与对齐分布式训练与计算硬件
方案设计
进阶