AI 编程 › AI 资讯 › 正文

Character Training for Risk-Averse Agents

arxiv · arXiv · 2026-09-30 01:42 · 评分 80

研究通过‘性格训练’让AI智能体学会风险厌恶,以减少不对齐智能体造成的灾难性危害;用CARA效用模型构建‘模型宪法’注入风险偏好,发现人格特质能稳健塑造智能体的风险选择。

原文:arXiv | 返回 AI 资讯列表