AI 编程 › AI 资讯 › 正文

When a Correct Reward Is Not Enough: Diagnosing and Guiding PPO in an Analytically Solved Broker-Trader Game

arxiv · arXiv · 2026-10-03 01:03 · 评分 78

在解析求解的连续时间经纪-交易商博弈中训练PPO智能体,利用金融数学解析解诊断和引导强化学习,揭示正确奖励不足时的训练问题,探索RL在金融最优控制中的应用。

原文:arXiv | 返回 AI 资讯列表