GRPO 组内奖励相同或方差接近零时,会有什么问题,如何处理?

暂无参考答案

未标记

本题目录

相关面经

4

唯品会

NLP 算法工程师
实习一面
查看原面经 →
GRPO 中相对奖励是如何计算的?同一组奖励方差接近零时如何处理

滴滴

算法工程师
实习
查看原面经 →
group 里 reward 全 0 / 全 1 会有什么问题

美图

大模型算法工程师
一面、二面、三面、四面
查看原面经 →
如何保证强化学习的训练效率(平衡效率和稳定),grpo训练过程中出现了全0或者全1怎么解决。

同花顺

大模型算法工程师(金融)
一面
查看原面经 →
grpo如果对于这个数据 训练出来的一组score都是0或者1  这时候应该怎么办

相关题目

4