AI 编程 › AI 资讯 › 正文

Credit Where It Matters: Dependency-Aware Policy Optimization for Terminal Agents

arxiv · arXiv · 2026-10-03 01:24 · 评分 80

提出依赖感知的信用分配方法用于终端Agent强化学习,显式追踪命令间读写依赖,避免训练信号分配给无关操作,提升编码、调试等多步终端任务的性能。

原文:arXiv | 返回 AI 资讯列表