小米

1 篇面经6 道面试题

已筛选

6 道题

排序:

0521
轨迹训练数据的规模、字段格式和生成方式是什么?
模型训练与对齐训练数据构建与治理
项目深挖
进阶
0522
轨迹模型采用什么动作空间?
模型基础与推理多模态与生成模型
原理机制
进阶
0523
线上长轨迹采集有哪些难点,VM 和沙盒环境如何同步?
模型训练与对齐训练数据构建与治理
方案设计
深入
0524
GRPO 如何实现,奖励函数尤其长轨迹奖励如何设计?
模型训练与对齐强化学习与奖励
方案设计
深入
0525
线上运行的轨迹模型如何判断任务已经完成?
Agent 原理与系统Agent 基础与运行循环
效果评估
进阶
0526
轨迹模型训练使用多少计算资源?
模型训练与对齐分布式训练与计算硬件
项目深挖
进阶