
標題Ask, Condition or Abstain: Reinforcement Learning for Missing-Premise Reasoning來源arXiv, 2608.16554v1?文章簡介研究問題當用戶查詢缺少得出唯一答案所需的關鍵前提時大語言模型應如何避免幻覺并做出有用響應主要貢獻論文提出了ACA-RL框架及MPB基準通過結構化獎勵訓練模型在信息缺失時主動詢問、條件化回答或棄權。重點思路構建推理圖引導的數據合成流水線將良構問題轉化為帶有局部缺口標注的缺失前提訓練實例生成12萬條高質量數據。設計包含五種行為分類的結構化獎勵函數優先獎勵主動詢問和條件化懲罰幻覺和無支持猜想。引入人工驗證的MPB基準涵蓋數學、邏輯及現實場景用于評估模型識別欠定任務及處理不確定性的能力。采用冷啟動SFT結合PPO算法進行訓練平衡缺失前提魯棒性與常規推理能力避免過度拒絕導致的性能下降。分析總結ACA-RL在MPB及第三方不可答基準上顯著優于Vanilla PPO和IDK-RL證明僅靠答案導向的RL無法有效處理缺失前提。模型行為呈現階段性演變早期快速學會棄權后期逐漸轉向更具信息量的條件化表達和主動詢問超越了簡單的“我不知道”。在保持GSM8K、AIME等常規推理任務競爭力的同時ACA-RL未出現嚴重的過度拒絕現象LiveBench得分與基線持平。推理圖引導的合成數據比隨機截斷或現有不可答數據集更能提升模型對邏輯缺口的敏感度及行為得分。個人觀點論文重新定義了推理模型的成功標準從單純追求正確答案擴展到識別任務欠定性并建設性響應核心突破是將模糊的“不確定性”拆解為可優化的具體行為層級。