arxiv · arXiv · 2026-10-03 01:03 · 评分 78
在解析求解的连续时间经纪-交易商博弈中训练PPO智能体,利用金融数学解析解诊断和引导强化学习,揭示正确奖励不足时的训练问题,探索RL在金融最优控制中的应用。
原文:arXiv | 返回 AI 资讯列表