會(huì)思考”的方法論)
Agentic Method—— 不是更多的 prompt而是一套讓模型輸出更可觀測(cè)、可證偽、可進(jìn)化的工作流。GitHub: https://github.com/Ghost-Silver/Agentic-Method一個(gè)越來越明顯的問題現(xiàn)在的 LLM尤其是中檔模型指令遵循能力已經(jīng)很強(qiáng)了。你讓它按格式輸出、按步驟執(zhí)行、調(diào)用工具它基本都能做到。但一到復(fù)雜任務(wù)——比如審查一個(gè)多文件代碼改動(dòng)、設(shè)計(jì)一組對(duì)照實(shí)驗(yàn)、或者推理一個(gè)系統(tǒng) bug 的根因——模型就開始出現(xiàn)兩種典型失敗幻覺自信地給出沒有依據(jù)的結(jié)論。事后合理化先跳到一個(gè)答案再編造一個(gè)看似合理的推理過程fake CoT。這些不是模型“不夠聰明”而是模型的解碼空間太大沒有足夠的外部約束把它錨定在“正確思考”的軌道上。我們的思路用方法論約束解碼空間我們開源的Agentic Method本質(zhì)上不是一套“提示詞合集”而是一套元工作流meta-workflow。它通過四個(gè)機(jī)制把模型的思考過程外化、結(jié)構(gòu)化、可審計(jì)1. 嚴(yán)格 DSL 錨定用類似(CTX)、(H)、(PREDICTION)、(OBSERVATION)、(VERDICT)的標(biāo)簽強(qiáng)制模型在每個(gè)關(guān)鍵節(jié)點(diǎn)聲明當(dāng)前上下文是什么假設(shè)是什么可證偽的預(yù)測(cè)是什么實(shí)際觀測(cè)到了什么最終裁決是什么這能把模型的輸出從“自由作文”變成“結(jié)構(gòu)化科研記錄”顯著降低幻覺。2. 強(qiáng)制深層推理每個(gè)關(guān)鍵結(jié)論必須附帶證據(jù)等級(jí)F0-F4置信度(CONF: level, 證據(jù)統(tǒng)計(jì))至少一個(gè)競爭假設(shè)(BRANCH)明確的證偽條件(FALSIFICATION)模型不能再停留在表面回答。3. 子 Agent 交叉審查通過FORM_REVIEWER、HYPOTHESIS_VALIDATOR、COUNTEREXAMPLE_REVIEWER等角色讓不同 Agent 互相挑錯(cuò)。循環(huán)論證、隱藏假設(shè)、事后合理化會(huì)被顯式標(biāo)記出來。4. 引入科研方法二分、消融、對(duì)照、反事實(shí)推理——這些方法不是作為“建議”寫在文檔里而是作為不可跳過的步驟嵌入 prompt。30 個(gè)核心 prompt覆蓋高風(fēng)險(xiǎn)任務(wù)倉庫里包含了 30 個(gè)已經(jīng)脫敏、可直接復(fù)用的核心 promptexperimental-design-prompt.md設(shè)計(jì)可驗(yàn)證的實(shí)驗(yàn)logical-inference-prompt.md嚴(yán)格邏輯推理與證明審查code-review-prompt.md系統(tǒng)性代碼審查debug-prompt.md因果排查與修復(fù)performance-optimization-prompt.md性能優(yōu)化決策prompt-evolution-prompt.md讓 prompt 自己進(jìn)化自己subagent-protocol.md18 個(gè)子 Agent 角色的協(xié)作協(xié)議……以及更多所有 prompt 都遵循同一套 DSL可以按需加載、組合、演化。Prompt 自動(dòng)進(jìn)化PEL最有意思的部分可能是Prompt Evolution LoopPEL。它的思路很簡單對(duì)同一個(gè)種子 prompt自動(dòng)生成多個(gè)變異版本用同一組真實(shí)任務(wù)并行評(píng)測(cè)然后保留適應(yīng)度最高的變體。我們已經(jīng)在示例報(bào)告中展示了一次真實(shí)的 PEL 運(yùn)行結(jié)果CONSTRAINT_ADD算子修復(fù)了一個(gè) P0 級(jí)協(xié)議一致性缺陷ANTI_PATTERN_BLOCK算子因?yàn)榕c既有規(guī)則矛盾而被廢棄EXAMPLE_INJECT算子需要與清單化調(diào)用點(diǎn)結(jié)合才有效。這些結(jié)論本身就是 prompt 工程從“玄學(xué)”走向“可實(shí)驗(yàn)科學(xué)”的證據(jù)。推薦配置這套方法論是為了高風(fēng)險(xiǎn)任務(wù)設(shè)計(jì)的會(huì)消耗更多 token 和上下文。但我們認(rèn)為值得。主 Agent / 編排層推薦 200B、200K 上下文的強(qiáng)模型子 Agent / 審查層可以用更便宜的中等模型運(yùn)行方式先讀main.md再按需加載對(duì)應(yīng) prompt。適用場(chǎng)景復(fù)雜代碼審查與架構(gòu)決策Bug 根因排查性能優(yōu)化實(shí)驗(yàn)設(shè)計(jì)科研論證與技術(shù)調(diào)研任何“說錯(cuò)一句話代價(jià)很高”的任務(wù)開源MIT 協(xié)議我們希望這套方法能被更多人驗(yàn)證、改進(jìn)、應(yīng)用到不同領(lǐng)域。如果你成功把它用到了軟件工程或科研之外的領(lǐng)域用 PEL 進(jìn)化出了更好的 prompt 變體發(fā)現(xiàn)了某個(gè) prompt 的漏洞歡迎在 GitHub 上開 Issue 或 PR。社區(qū)會(huì)一起積累更多領(lǐng)域的 adapter 和最佳實(shí)踐。下一步打開倉庫https://github.com/Ghost-Silver/Agentic-Method從core/master-prompt.md開始讀選一個(gè)你正在頭疼的復(fù)雜任務(wù)試試experimental-design-prompt.md或debug-prompt.md如果有效回來點(diǎn)個(gè) ?或者分享你的使用案例這不是又一個(gè) prompt 倉庫。這是一套讓 LLM 學(xué)會(huì)像科研人員一樣思考的工作流。https://github.com/Ghost-Silver/Agentic-Method