阿里百炼 · 2026-05-31 00:00
模型调优 · 模型调优新增强化学习训练 (邀约制) · 提供强化学习 (RL) 训练能力, 支持基于奖励信号优化模型策略, 当前邀约制开放,。来源:阿里百炼。
原文:阿里百炼 | 返回 AI 资讯列表