arxiv · arXiv · 2026-09-30 01:42 · 评分 80
研究通过‘性格训练’让AI智能体学会风险厌恶,以减少不对齐智能体造成的灾难性危害;用CARA效用模型构建‘模型宪法’注入风险偏好,发现人格特质能稳健塑造智能体的风险选择。
原文:arXiv | 返回 AI 资讯列表