laxman发布Step-Jev,为无标准答案的agent RL提供逐步奖励
laxman称,DeepSeek R1之后常见做法是只奖励最终答案以避免逐步奖励被钻空子,但团队发现相反结果。Step-Jev提供step-by-step rewards;冻结正文在“our agent learned”处截断,未给出具体实验结果。
共 1 个事件 · 门户最近更新
laxman称,DeepSeek R1之后常见做法是只奖励最终答案以避免逐步奖励被钻空子,但团队发现相反结果。Step-Jev提供step-by-step rewards;冻结正文在“our agent learned”处截断,未给出具体实验结果。