
文章核心總結與翻譯一、主要內容本文提出了一種可解釋的混合框架,用于大規模文本語料庫的敘事分析,核心是將詞袋模型(BoW)的主題建模與基于大型語言模型(LLM)的問答(QA)敘事模型相結合,共享再生核希爾伯特空間(RKHS)的潛在表示。核心流程主題篩選:通過BoW主題模型對語料庫進行無監督主題學習,由LLM篩選出與用戶興趣相關的主題及對應文檔;問答生成:LLM設計分類問題并對篩選后的文檔作答,將文檔轉化為結構化的QA向量;敘事建模:基于QA數據構建雙softmax敘事模型,每個敘事對應一組問答概率分布(PMF),可解釋為對語料的連貫視角;高效推斷與外推:通過函數梯度下降實現模型學習,借鑒Transformer架構設計上下文問答外推機制,無需重復查詢LLM即可預測未標注文檔的問答結果;多場景驗證:在聯合國大會演講(2002-2007)、NeurIPS會議論文(1987-2019)等數據集上驗證,支持跨語言分析(中英雙語)。關鍵優勢可解釋性:從問題設計、敘事結構到證據溯源均透明可審計;高效性:減少LLM重復調用成本,支持大規模語料擴展;靈活性:適配多語言、多領域(地