如何根据业务目标设计强化学习奖励?

暂无参考答案

未标记

本题目录

相关面经

8

科大讯飞

大模型算法工程师
秋招一面
查看原面经 →
项目追问
研究过程如何结合实现奖励函数的

百度

端到端决策规划控制算法工程师
一面
查看原面经 →
项目追问
reward是如何设计的呢?
项目追问
奖励函数怎么写的?

百度

Agent 应用开发工程师
一面、二面
查看原面经 →
eward 和 verifier 怎么设计

滴滴

算法工程师
实习
查看原面经 →
业务场景里的 reward 应该怎么设计

美图

大模型算法工程师
一面、二面、三面、四面
查看原面经 →
介绍第一篇论文,reward model怎么设计。
展开剩余 3 篇面经

字节跳动

大模型算法工程师
暑期实习一面、二面、三面
查看原面经 →
比如reward怎么设计的

荣耀

大模型算法工程师
实习
查看原面经 →
RL的时候奖励函数是如何设计的?最终效果怎么样?

虾皮

大模型算法工程师
校招二面
查看原面经 →
介绍reward fuction

相关题目

4