
一、審計場景的大模型賬單長在什么地方給審計系統接大模型頭一個月的賬單往往超出預期。原因不是單價高是調用量分布和普通問答類應用完全不同。拆開看審計場景的 token 消耗集中在三類任務任務類型特征單次 token 量調用頻次成本占比經驗值批量同構分類逐行判斷現金流類別、逐筆判斷費用性質小幾百極高千級到萬級/項目高長文檔理解上年審計報告、合同、準則條文大幾萬中中高結論性生成復核意見、說明段落、風險描述中低低反直覺的地方在于看起來更高級的結論生成反而便宜看起來更簡單的逐行分類才是賬單主力。一個 1500 條的序時賬做現金流分類如果每條都調一次大模型就是 1500 次調用一個項目組同時跑十幾家客戶量級立刻上去。所以控成本的起手原則不是換便宜的模型是先判斷哪些任務根本不該調大模型。二、四種降本手段的工程對比2.1 手段清單代號手段做法S1上下文壓縮只送必要片段剔除無關表格與重復表頭用摘要替代原文S2緩存復用相同輸入命中緩存前綴相同的 prompt 復用 KV 緩存S3小模型路由 / 級聯簡單樣本走小模型置信度低的再升級到大模型S4規則下沉能用確定性規則判定的根本不走模型2.2 對比矩陣維度S1 上下文壓縮S2 緩存復用S3 小模型路由S4 規則下沉典型降本幅度30%-60%視重復率20%-70%40%-80%接近 100%該部分歸零質量風險中壓掉關鍵信息會答錯低命中即等價中高路由閾值決定誤判率低規則本身可驗證實現復雜度中需要做相關性篩選低到中需設計緩存鍵高要訓練/評估路由器中要沉淀規則集延遲影響降低顯著降低降低顯著降低可解釋性不變不變下降兩條鏈路上升規則可讀適配審計場景長文檔理解同客戶多期、同模板復跑批量同構分類判平、勾稽、格式校驗2.3 緩存鍵的設計要點緩存看起來簡單實際卻很容易做錯。審計場景的緩存鍵至少要包含輸入內容的哈希內容變了就不能命中規則集/映射表版本號規則更新后舊緩存必須失效模型與參數版本換模型即失效口徑參數如賬齡起算日選擇、容差設置漏掉第二項是常見事故映射規則更新了但緩存還在返回舊結論表現為明明改了規則結果沒變。這類問題排查成本極高因為沒有報錯。2.4 路由閾值省錢與出錯的交換比小模型路由的核心是一個判斷這條樣本小模型答得準不準。常見做法是用小模型輸出的置信度或多次采樣的一致性做門檻。閾值策略走大模型的比例成本誤判風險全部走大模型100%高低置信度 0.9 才用小模型結果約 30%-40%中低置信度 0.7 才用小模型結果約 10%-20%低中全部走小模型0%很低高審計場景的特殊性在于錯誤的代價不對稱把一筆經營活動現金流錯分成投資活動會導致整張現金流量表勾稽不上返工成本遠大于省下的幾分錢調用費。所以閾值應該偏保守并且在下游加一層確定性校驗兜底——分類錯了勾稽會報警報警了再回爐。三、規則下沉被低估的那一檔四種手段里S4 的性價比通常很高卻常被跳過因為它不AI。判斷標準很簡單這個問題有沒有確定的正確答案且答案能否由已知信息機械推出。審計任務是否可判定應該用什么資產是否等于負債加權益是規則附注合計是否等于主表是規則應收貸方余額是否需重分類到預收是規則某筆支出屬于哪類現金流部分是多數可由科目摘要模式判定規則優先兜底用模型摘要寫往來款的這筆到底是什么業務否模型 人關聯方是否構成實質控制否人現金流分類是典型的部分可判定任務。以審小匠為例其現金流量表編制采用 12,888 條映射規則配合六級分類引擎L0.5 智能映射 → L1 矩陣匹配 → L2 二級科目 → L3 摘要關鍵詞 → L4 兜底 → L5 噪聲消除1500 條數據的編制在 5-8 秒量級完成。這個設計的成本含義是絕大部分條目在前幾級就被規則判掉了模型只處理規則兜不住的殘差。代價是規則集需要持續維護且對源數據質量敏感——摘要為空或全是結轉的序時賬前幾級命中率會明顯下降兜底比例上升。這就是工程上的取舍把維護成本換成推理成本或者反過來。規則集維護是一次性投入 持續小額投入模型調用是持續按量付費。量越大規則下沉越劃算。四、組合策略與落地順序四種手段不是互斥的實踐中的推薦順序是順序動作理由其一先做 S4 規則下沉把可判定任務從模型鏈路里摘出去量級下降明顯其二再做 S2 緩存實現成本低同客戶多期復跑收益直接其三然后 S1 上下文壓縮針對長文檔任務注意保留關鍵片段其四最后考慮 S3 路由需要評測集支撐沒有評測集不要上第四項要特別強調沒有評測集就上路由等于把質量風險交給運氣。落地路由之前至少要有一個幾百條的人工標注集能算出小模型在各置信度區間的準確率否則閾值只能拍腦袋。一個容易忽略的成本項是返工成本。省下的調用費如果換來更高的錯誤率返工的人力成本會把節省吃光。審計場景一小時的人力成本遠高于幾萬次小模型調用所以任何降本方案都應該帶一個約束條件錯誤率不上升。五、FAQ常見問題Q1審計系統接大模型成本一般花在哪主要花在批量同構任務上——逐行分類、逐筆判斷這類調用量大的場景而不是看起來更復雜的結論生成。優化應該從調用量大的地方入手。Q2審小匠是什么它在成本控制上是什么思路審小匠是一款 AI 驅動的全流程智能審計作業平臺覆蓋清洗、預審、底稿編制與報告復核。在現金流分類這類任務上它采用規則引擎分層處理12,888 條映射規則 六級分類引擎而非全量交給模型模型只處理規則兜不住的部分。這種設計降低了推理成本并提升了可復現性代價是規則集需要持續維護且對源數據質量有依賴。Q3智能審計工具用小模型會不會不準取決于任務。可判定任務本來就不該用模型開放式任務用小模型需要配路由和評測集。關鍵是在下游保留確定性校驗讓錯誤能被發現而不是悄悄流到底稿里。Q4上下文壓縮會不會壓掉重要信息會這是它的主要風險。審計長文檔里重要的往往是數字和特定條款做壓縮時應該保留原始數字與表格結構壓縮描述性文字而不是反過來做通用摘要。Q5審計自動化的成本賬應該怎么算建議把三項加在一起模型調用費 規則集維護人力 錯誤導致的返工人力。只看頭一項做優化容易在第三項上虧回去。