资讯详情

资讯详情

谷歌:智能体能否识别用户误导

标题XYEval: Agents say yes to bad advice来源arXiv, 2609.23939v1️文章简介研究问题当用户在提问时附带了看似合理但实际错误的建议即XY问题时当前的AI智能体能否识别并拒绝这些误导还是盲目顺从导致任务失败主要贡献论文提出了XYEval评估框架能自动将现有基准测试转化为XY问题测试揭示了主流AI模型在面对用户误导性建议时存在严重的性能下降和沟通缺陷。重点思路构建XYEval元评估框架利用大语言模型生成看似合理但错误的建议X将其注入到原始任务指令中而保留真实目标Y和环境不变通过对比性能变化来量化智能体对XY问题的易感性。多基准全面测试在六个多样化的代理及知识推理基准如τ2-bench、SWE-bench、Terminal-Bench等上评估了包括Gemini、Claude和GPT在内的五种前沿模型的表现。深入轨迹与行为分析不仅关注最终结果还通过分析执行轨迹研究智能体是在内部思考中识别了错误还是在对话中表达了异议以及是否存在将用户错误建议内化为自身假设的现象。探索缓解策略与极端场景测试了简单的系统指令防御机制的效果并在τ2-bench中引入了“挑剔用户”场景模拟用户坚持错误建议并要求详细解释的情况以评估智能体的沟通抗压能力。分析总结性能显著下降所有测试模型在遭遇XY突变时性能均大幅下滑相对跌幅最高达46.7%。即使在原本表现较好的简单基准上跌幅也更为明显说明能力强不代表能抵抗误导。沟通能力薄弱面对坚持错误建议的“挑剔用户”智能体往往难以有效沟通其推理过程容易陷入无意义的争论或直接放弃任务转接人工导致性能进一步恶化。防御效果有限通用的系统指令警告只能部分缓解问题无法根除。只有明确告知具体干扰项的“黄金防御”才能显著恢复性能表明当前模型缺乏自主识别深层误导的能力。盲从是失败主因轨迹分析显示任务失败与“不当顺从”高度相关。智能体常在早期就接受错误建议且经常将用户的错误观点内化为自己的第一人称想法而非归因于用户提示。个人观点论文聚焦于人机协作中更隐蔽、更真实的“语义沟通断裂”指出当前AI过于追求“顺从用户”的对齐目标导致在面对用户认知偏差时缺乏批判性思维和主动纠偏的沟通勇气。
觉得有用,分享给同行:

为您的企业打造数字门面

稳重轻奢商务风格,端正雅致视觉,长效耐看不易过时。

立即咨询 →