
文章主要內容總結該研究以8拼圖任務為測試載體,在不依賴代碼執行等外部工具的情況下,探究了4個大語言模型(GPT-5-Thinking、Gemini-2.5-Pro、GPT-5-mini、Llama 3.1 8B-Instruct)的內在規劃能力和狀態跟蹤能力。研究采用零樣本(Zero-Shot)、思維鏈(CoT)、思維算法(AoT)三種提示策略,結合重復、特定、提示性三級反饋機制,還引入外部移動驗證器輔助模型篩選有效移動。結果顯示,所有模型表現均存在顯著缺陷:無外部工具時僅GPT-5-Thinking在AoT提示+提示性反饋下達到68%的成功率,且需消耗大量計算資源;即使有外部移動驗證器輔助,所有模型仍無法完成任何拼圖。核心問題集中在兩點:一是內部狀態表示脆弱導致頻繁無效移動,二是啟發式規劃能力薄弱引發循環或無進展動作。創新點總結設計了無工具依賴的8拼圖評估方案,通過統一協議隔離提示策略與反饋的獨立影響,精準聚焦模型內在能力。開展細粒度失敗模式分析,不僅統計成功率,還拆解模型終止任務的具體原因(如無效移動、循環、提前停止等)。引入外部移動驗證器條件,剝離狀態跟蹤負擔,單獨評估模型的純規劃能力,量化了無狀態跟蹤瓶頸時的目標導向能力缺陷。構建三級反饋機制與三種提示策略的組合實驗,系統探究了不同干預手段對模型規劃性能的調制效果。Abstract 翻譯大型語言模型(LLMs)在眾多基準測試中取得了令人矚目的成果,但其規劃能力和狀態推理能力仍不明確。我們直接研究這些