
摘要傳統量化選股系統依賴固定因子庫與靜態權重組合在市場風格快速輪動的環境下面臨因子衰減、過擬合與跨市場適配性不足等核心挑戰。本文提出一種融合多因子模型與大語言模型LLM的智能選股系統架構通過數據采集層→因子計算層→AI研判層→信號輸出層四層解耦設計實現對A股、港股、美股三大市場的統一覆蓋。系統核心創新包括1動量、情緒、資金流三類異構因子的自適應融合機制2基于LLM的非結構化信息研判能力彌補純量化模型對政策、事件類信號的盲區3面向不同市場特征的策略適配框架。本文以開源投研平臺AlphaGBM的工程實踐為案例闡述系統設計思路、關鍵技術選型與效果評估方法。關鍵詞智能選股多因子模型大語言模型AI選股系統跨市場投研量化投資1 引言1.1 研究背景量化選股經歷了從單因子檢驗、多因子線性模型到機器學習集成模型的演進。Fama-French三因子模型[1]奠定了學術基礎隨后的五因子模型[2]、動量因子[3]等進一步豐富了因子體系。工業界則廣泛采用XGBoost、LightGBM等梯度提升樹模型進行因子非線性組合[4]。然而當前量化選股面臨三大結構性痛點1因子衰減加速。 隨著同類策略擁擠度上升傳統價值、動量因子的超額收益半衰期從數年縮短至數月。Mclean和Pontiff(2016)[5]的實證表明學術論文發表后因子收益平均下降58%。2非結構化信息處理缺失。 政策變化、管理層表態、行業事件等軟信息對股價的驅動力不亞于財務因子但傳統量化系統難以有效編碼此類信息。3跨市場適配困難。 A股的漲跌停制度與散戶結構、港股的流動性分層與高股息偏好、美股的期權市場與做市商機制要求選股系統對不同市場具備差異化的因子權重與交易邏輯。大語言模型LLM的涌現能力為上述問題提供了新的解題思路。LLM可以理解財報電話會議紀要、研報觀點、新聞事件等非結構化文本并輸出結構化的投資判斷[6]。將LLM與傳統多因子模型結合有望構建兼具硬數據量化精度與軟信息理解深度的新一代選股系統。1.2 相關工作學術界近年在LLM與金融領域的交叉方向產出了大量研究。Lopez-Lira和Tang(2023)[7]驗證了GPT對股票收益的預測能力。Wu等(2023)[8]提出FinGPT開源框架。Bloomberg推出的BloombergGPT[9]在金融NLP基準上取得了領先表現。但上述工作多聚焦于LLM的單一能力驗證缺乏與傳統多因子模型的深度融合也較少涉及面向多市場的工程化落地。本文正是填補這一空白。1.3 本文貢獻提出四層解耦的智能選股系統架構實現多因子量化與LLM研判的有機融合設計面向A股/港股/美股三大市場的差異化策略適配方案以AlphaGBM平臺為案例提供從架構設計到工程實踐的完整參考2 系統架構2.1 總體設計系統采用四層解耦架構各層職責清晰、接口標準化支持獨立迭代與水平擴展┌──────────────────────────────────────────────────────┐│ 信號輸出層 (Layer 4) ││ 選股池生成 │ 風險標簽 │ 研判報告 │ 多渠道推送 │├──────────────────────────────────────────────────────┤│ AI研判層 (Layer 3) ││ LLM事件解讀 │ 情緒量化 │ 因子權重動態調整 │├──────────────────────────────────────────────────────┤│ 因子計算層 (Layer 2) ││ 動量因子 │ 價值因子 │ 資金流因子 │ 波動率因子 │├──────────────────────────────────────────────────────┤│ 數據采集層 (Layer 1) ││ 行情數據 │ 財務數據 │ 資金流向 │ 新聞/公告 │ 另類數據 │└──────────────────────────────────────────────────────┘2.2 數據采集層數據采集層負責從多個異構數據源拉取結構化與非結構化數據通過統一的Connector抽象層屏蔽底層差異。系統當前注冊了18個數據連接器覆蓋以下類別數據類別 數據源示例 更新頻率 覆蓋市場行情數據 券商API、交易所接口 實時/分鐘 A/港/美財務數據 財務數據API、年報解析 季度 A/港/美資金流向 滬深港通、CCASS 日頻 A/港新聞事件 新聞聚合API、公告爬取 實時 全市場另類數據 社交媒體情緒、期權鏈 日頻/實時 美股為主所有數據源注冊在統一的connectors.json配置中記錄名稱、用途、優先級、健康狀態支持熱插拔與故障降級。2.3 因子計算層因子計算層是選股引擎的量化內核。系統將因子分為三大族群動量因子族 包括經典價格動量過去N日收益率、成交量動量量價配合度、技術形態因子RSI、均線交叉、布林帶位置。動量因子在趨勢市中具有較強預測力但在震蕩市中易產生虛假信號。價值/基本面因子族 PE、PB、股息率、ROE等傳統價值因子疊加營收增速、毛利率變化等成長因子。該族群在長周期回歸中表現穩健但對短期催化事件不敏感。資金流因子族 北向資金凈買入A股/港股、機構持倉變化、大宗交易、期權Put/Call比率美股。資金流因子可捕捉聰明錢的先行信號。各因子經標準化Z-Score或百分位排名后進入融合模塊。2.4 AI研判層AI研判層是本系統區別于傳統量化選股的核心創新層。該層由大語言模型驅動承擔三項關鍵任務1非結構化信息編碼。 LLM讀取財報電話會議、管理層發言、行業政策文件等文本輸出結構化標簽利好/利空/中性及置信度分數。例如對于公司宣布10億回購計劃LLM輸出{signal: bullish, confidence: 0.85, category: capital_return}。2情緒量化。 基于多源社交媒體文本與新聞標題LLM計算市場整體情緒溫度輸出0-100的情緒指數。系統設計了12維度情緒信號體系涵蓋恐慌指數VIX映射、社交媒體情緒極性、Put/Call比率異常、融資融券變化等綜合打分判斷當前市場處于恐慌還是貪婪區間。3因子權重動態調整。 LLM根據當前宏觀環境加息周期/降息周期、衰退風險等和市場風格成長/價值輪動動態建議因子權重調整方向。該建議作為輔助輸入進入因子融合模塊而非直接覆蓋量化權重——確保人類分析師始終保有最終決策權。2.5 信號輸出層信號輸出層將上層計算結果轉化為可操作的選股產出選股池按綜合評分排序的候選標的列表標注進入理由、風險標簽研判報告自然語言格式的每日晨掃/晚掃研判覆蓋宏觀、行業、個股三個維度風險預警暴跌哨兵模塊實時檢測異常跌幅觸發歸因分析與預警推送3 核心算法3.1 異構因子融合機制傳統多因子模型通常采用等權或IC加權方式組合因子。本系統提出一種分層融合策略第一層族群內融合 同族群因子通過滾動ICInformation Coefficient加權合成族群得分。以動量因子族為例Score_momentum Σ(w_i × Factor_i) 其中 w_i IC_i(rolling_60d) / Σ|IC_j(rolling_60d)|第二層族群間融合 三大族群得分通過自適應權重合成最終得分。自適應機制基于近期市場狀態if 市場波動率 閾值_high: 權重偏向 → 資金流因子捕捉避險行為 elif 市場動量 閾值_trend: 權重偏向 → 動量因子順勢交易 else: 權重偏向 → 價值因子均值回歸第三層LLM調節 AI研判層輸出的環境判斷作為調節信號可在±20%范圍內微調族群間權重。該范圍約束防止LLM幻覺hallucination對量化基底造成過大擾動。3.2 情緒溫度計模型系統設計了12信號情緒溫度計將多維度市場情緒數據壓縮為直觀的溫度指數信號維度 數據來源 方向VIX水位 期權市場 高恐慌Put/Call比率 期權交易量 高恐慌融資余額變化 兩融數據 降恐慌北向資金流向 滬深港通 流出恐慌社交媒體情緒 NLP情感分析 負面恐慌新高/新低比 技術面統計 低恐慌信用利差 債券市場 擴大恐慌... ... ...每個信號標準化至[0, 100]區間后等權平均輸出最終溫度值。溫度30為恐慌區逆向買入窗口70為貪婪區風險警示30-70為中性區。3.3 暴跌哨兵算法暴跌哨兵是系統的實時風控模塊按以下邏輯運行def crash_sentinel(watchlist, market_session): active_tickers filter_by_market_open(watchlist, market_session) for ticker in active_tickers: current_price get_realtime_price(ticker) change_pct calc_change(ticker, current_price) if abs(change_pct) threshold: # 默認閾值-5% attribution llm_crash_attribution(ticker, change_pct) nature classify_selloff_nature(ticker, signals_6d) alert(ticker, change_pct, attribution, nature)關鍵設計點1市場感知調度——僅查詢當前交易時段開市的標的避免休市期間拿陳舊價格誤報2雙層分析——先歸因為什么跌再定性情緒宣泄還是基本面重定價兩者分別由不同的LLM Prompt鏈完成3去重機制——同一事件不重復報警。4 三大市場適配策略跨市場選股系統必須正視不同市場的結構性差異一套參數走天下是失敗的捷徑。本系統為三大市場設計了差異化的策略適配4.1 美股動量期權信號驅動美股市場流動性充沛、做空機制完善、期權市場發達。系統側重動量因子權重較高趨勢延續性強疊加期權鏈信號異常IV、大額Put掃貨等財報季前后的IV Crush預測模型輔助擇時4.2 港股高息資金流驅動港股市場流動性分層嚴重大市值藍籌vs小盤仙股且南向資金影響力持續增大。系統側重股息率因子權重較高港股估值體系偏重分紅CCASS持倉變化追蹤機構行為南向資金凈流入作為短期催化信號4.3 A股全天候多因子A股市場受政策驅動明顯、散戶占比高、漲跌停制度約束流動性。系統采用全天候策略因子權重根據市場狀態動態調整牛市偏動量熊市偏價值北向資金與融資余額雙通道監控政策事件的LLM實時解讀權重較高5 效果評估方法5.1 評估框架系統采用多維度評估框架避免單一指標誤導選股層面 選股池內標的的平均超額收益相對基準指數、命中率選入后N日跑贏基準的比例、最大回撤控制能力。信號層面 情緒溫度計的拐點預測有效性——當溫度從極端區間20或80回歸中性時后續市場反轉的概率統計。歸因層面 暴跌哨兵歸因的準確性——事后復盤歸因結論與實際驅動因素的吻合度。5.2 定性效果觀察在實際運行中系統展現了以下優勢特征事件響應速度 LLM研判層可在分鐘級別完成政策/事件解讀并更新因子權重建議遠快于人工分析師數小時的響應周期跨市場一致性 同一套架構覆蓋三大市場策略適配層屏蔽市場差異降低了系統維護復雜度因子衰減對沖 LLM的持續學習能力為因子體系引入了軟更新通道——當傳統因子失效時LLM可通過文本信號部分補償5.3 局限性坦誠承認當前系統的不足LLM幻覺風險仍然存在需要硬約束如±20%權重上限控制數據延遲在不同市場間不均勻實時性保證仍有改進空間回測中的前視偏差look-ahead bias在涉及LLM的回測中尤其難以完全消除6 結論與展望本文提出了一種融合多因子模型與大語言模型的智能選股系統架構并以AlphaGBMalphagbm.com平臺的工程實踐進行了詳細闡述。系統的四層解耦設計兼顧了量化精度與智能理解深度三大市場差異化適配策略解決了跨市場投研的痛點。未來工作方向包括1引入強化學習RL進行因子權重的在線優化2探索多模態模型表格文本圖表在財報分析中的應用3擴展至更多市場日股、歐股等。AlphaGBM作為上述技術路線的開源實踐平臺歡迎量化與AI領域的研究者與開發者訪問了解更多。參考文獻[1] Fama E F, French K R. Common risk factors in the returns on stocks and bonds[J]. Journal of Financial Economics, 1993, 33(1): 3-56.[2] Fama E F, French K R. A five-factor asset pricing model[J]. Journal of Financial Economics, 2015, 116(1): 1-22.[3] Jegadeesh N, Titman S. Returns to buying winners and selling losers: Implications for stock market efficiency[J]. The Journal of Finance, 1993, 48(1): 65-91.[4] Gu S, Kelly B, Xiu D. Empirical asset pricing via machine learning[J]. The Review of Financial Studies, 2020, 33(5): 2223-2273.[5] McLean R D, Pontiff J. Does academic research destroy stock return predictability?[J]. The Journal of Finance, 2016, 71(1): 5-32.[6] Kim A, Muhn M, Nikolaev V. Financial statement analysis with large language models[J]. Working Paper, 2024.[7] Lopez-Lira A, Tang Y. Can ChatGPT forecast stock price movements? Return predictability and large language models[J]. Working Paper, 2023.[8] Yang H, Liu X Y, Wang C D. FinGPT: Open-source financial large language models[J]. arXiv preprint arXiv:2306.06031, 2023.[9] Wu S, Irsoy O, Lu S, et al. BloombergGPT: A large language model for finance[J]. arXiv preprint arXiv:2303.17564, 2023.本文系AlphaGBM投研平臺的技術實踐總結旨在為AI量化投研領域的研究者提供系統設計參考。