美图

1 篇面经20 道面试题

已筛选

20 道题

排序:

2704
如何根据业务目标设计强化学习奖励?
模型训练与对齐强化学习与奖励
方案设计
进阶
2788
介绍论文背景、方法、创新点和输入输出。
项目与综合面试能力成长与学习方法
项目深挖
进阶
2789
过程监督信号如何设计,还能用于哪些任务?
模型训练与对齐预训练、续训与 SFT
方案设计
进阶
2790
如何平衡强化学习训练效率与稳定性?
模型训练与对齐强化学习与奖励
方案设计
进阶
2791
混合推理如何实现,增强推理时如何避免遗忘通用能力?
模型基础与推理模型选型与能力边界
原理机制
进阶
2792
大模型还有哪些值得增强的能力?
模型训练与对齐预训练、续训与 SFT
开放讨论
2793
是否阅读过 Qwen2.5-VL 技术报告,理解哪些内容?
模型基础与推理多模态与生成模型
经历介绍
2794
小模型做强化学习是否有效,如何选择模型与每轮数据规模?
模型训练与对齐强化学习与奖励
比较选型
进阶
2795
科研中遇到哪些困难和失败路线,如何判断并调整?
项目与综合面试能力成长与学习方法
行为面
2796
论文方法能否泛化到垂直领域?
模型训练与对齐Verifier 与训练评测
效果评估
进阶