
1. 從“存算”到“智算”AI負載重塑數據基礎設施的底層邏輯最近和幾個做數據平臺和數據庫內核的朋友聊天話題總繞不開一個核心AI。不是討論哪個大模型又出了新版本而是大家手頭的活兒從底層的存儲、計算到上層的查詢引擎都在被AI工作流帶來的新需求“推著走”。過去我們談數據基礎設施核心是“存”和“算”——如何更高效地存儲海量數據如何更快地進行批量或交互式分析。但今天當AI模型訓練、推理、Agent應用成為業務的核心負載時整個數據棧的需求圖譜發生了根本性的偏移。這不再是簡單的性能優化而是一場從設計哲學到技術組件的系統性演進。我理解這種演進核心驅動力在于AI工作流與傳統數據分析工作流在數據形態、處理范式、時效要求和資源消耗上的巨大差異。傳統分析型數據庫比如我們熟悉的Apache Doris、ClickHouse擅長處理規整的、結構化的表格數據通過高效的列式存儲和向量化引擎在聚合、篩選、關聯查詢上做到極致。但AI特別是大模型相關的工作流處理的數據對象復雜得多它可能是海量的非結構化文本、圖像、音視頻需要先經過Embedding轉換成高維向量也可能是模型訓練過程中產生的海量中間狀態Checkpoint、參數和日志還可能是Agent執行時動態生成的、帶有復雜邏輯狀態的交互數據。這些數據對基礎設施提出了三個新要求對多模態數據的原生支持、對高吞吐和低延遲的混合需求、以及對彈性與成本更精細的管控。因此當我們探討“AI成為主流負載后數據基礎設施將如何演進”時我們實際上是在探討一套全新的技術棧如何從萌芽走向成熟。這個演進路徑并非一蹴而就地替換掉現有系統而是一個在現有堅實基礎上通過架構解耦、組件增強和生態融合逐步構建“AI原生”能力的過程。接下來我將結合當前業界的實踐和趨勢拆解這場演進中的幾個關鍵戰場。2. 架構演進從“緊耦合”到“湖倉管一體”的智能化融合傳統的數據倉庫或數據湖架構在面對AI負載時常常顯得力不從心。數倉強于分析但對半結構化、非結構化數據支持弱數據湖雖能存萬物但缺乏高效的管理和查詢能力。AI工作流恰恰需要同時跨越這兩個世界既要對原始的多模態數據進行預處理和特征提取湖的能力又要對結構化的特征數據、樣本數據進行高效地迭代訓練倉的能力還要對模型、向量等新型數據資產進行統一管理和服務管的能力。這催生了“湖倉管一體”Lakehouse AI Governance架構的興起與深化。2.1 解耦與分層應對AI負載的復雜性AI負載的復雜性首先要求架構上的清晰解耦。一個面向AI的現代數據平臺其底層邏輯正在從“一個系統解決所有問題”轉向“一組專門化組件通過開放協議協同工作”。存儲層對象存儲如S3、OSS因其無限的擴展性和成本效益已成為存儲原始數據、訓練數據、模型Checkpoint的絕對主力。但在其上需要一層智能的“數據管理層”這不僅僅是元數據管理更是對數據版本、血緣、質量以及訪問策略的全面管控。例如使用類似Delta Lake、Apache Iceberg這樣的開源表格式可以在對象存儲之上構建出具有ACID事務、模式演進、時間旅行等數據庫特性的數據表這對于需要可重復實驗和追溯的AI訓練流程至關重要。計算層計算與存儲的分離已是共識。針對AI的不同階段計算引擎進一步專業化數據預處理與特征工程Spark、Flink等批流一體引擎仍是主力但其生態正在積極集成機器學習庫如Spark MLlib和向量計算能力。模型訓練專用AI框架PyTorch, TensorFlow及其分布式訓練框架如DeepSpeed, FSDP主導。它們與底層資源調度器Kubernetes和存儲系統的協同效率直接決定了訓練集群的利用率。模型推理與向量檢索這是在線服務的關鍵需要極低的延遲和高吞吐。專門的模型服務框架如Triton Inference Server和向量數據庫如Milvus, Weaviate在此扮演核心角色。它們需要與上層的應用和下游的分析系統緊密集成。查詢與服務層這是用戶和應用程序與數據交互的界面。傳統的分析型數據庫如Apache Doris在此層的演進尤為關鍵。它不再僅僅是一個SQL查詢引擎而是需要演變成一個“智能數據服務網關”。這意味著它需要具備聯邦查詢能力能夠無縫查詢存儲在數據湖通過Iceberg等、關系數據庫、乃至向量數據庫中的數據為用戶提供統一的訪問入口。內置AI函數提供原生的向量相似度搜索函數如cosine_distance、模型推理函數如調用部署好的模型進行實時預測使得在SQL中直接進行AI應用開發成為可能。高性能對接優化與向量數據庫、模型服務之間的數據交換協議減少網絡開銷和序列化成本。實操心得在架構選型時切忌追求“大一統”的萬能系統。正確的思路是優先定義清晰的層次和接口選擇在每個層次上表現最優、生態最活躍的開源或商業組件。例如用對象存儲Iceberg做統一存儲層用Kubernetes統一調度計算任務Spark作業、PyTorch訓練任務再用Apache Doris作為統一的查詢與服務入口。這種組合的靈活性和可擴展性遠勝于單一系統。2.2 Apache Doris的定位演進從分析數據庫到智能數據服務層以Apache Doris為例我們可以清晰地看到一個經典MPP分析型數據庫在AI浪潮下的演進思路。它沒有試圖自己去存儲非結構化數據或訓練模型而是通過持續增強其“連接器”和“計算能力”穩固自身作為“智能數據服務層”的核心地位。核心增強方向一全方位的數據湖對接。Doris社區近年來大力投入了對Iceberg、Hudi等數據湖表格式以及Hive、Delta Lake的直接對接能力。通過Multi-Catalog功能用戶可以在Doris中直接創建外部數據目錄像查詢本地表一樣查詢數據湖中的表數據無需移動。這對于AI場景至關重要因為特征數據往往首先沉淀在數據湖中。Doris負責提供高性能的SQL分析能力而海量原始數據仍由成本更低的對象存儲來承載。核心增強方向二向量化搜索與AI函數集成。這是Doris邁向“AI原生”的關鍵一步。新版本中Doris引入了原生的向量數據類型ARRAYFLOAT以及一系列向量函數如cosine_similarity,l2_distance。這意味著你可以將Embedding生成的向量直接存入Doris并通過SQL進行快速的近似最近鄰ANN搜索。雖然專業的向量數據庫在超大規模、高維向量的檢索上仍有優勢但對于許多將向量搜索與復雜屬性過濾、聚合分析結合的場景例如“找到與這張圖片相似且價格低于100元、上架時間在一周內的商品”Doris這種在單一系統中完成混合查詢的能力極大地簡化了架構和開發復雜度。核心增強方向三作為模型推理與特征服務的統一入口。通過UDF用戶自定義函數框架Doris可以方便地集成外部模型服務。例如你可以部署一個PyTorch模型服務然后在Doris中創建一個UDF來遠程調用該服務。這樣在數據查詢和分析的流水線中可以實時調用AI模型進行情感分析、欺詐檢測、推薦評分等實現真正的“分析智能一體化”。這避免了將數據導出到專門的應用系統進行處理的繁瑣步驟讓AI能力更貼近數據。3. 核心組件革新向量數據庫、模型倉庫與數據流水線在解耦的架構下一些為AI而生的新型組件正從“可選”變為“必選”。它們的成熟度直接決定了AI數據基礎設施的效能上限。3.1 向量數據庫非結構化數據的“索引器”與“連接器”向量數據庫的核心價值在于為高維向量數據提供了高效的存儲、索引和檢索能力。你可以把它理解為非結構化數據文本、圖片、音頻的“搜索引擎索引”。它的出現解決了傳統關系型數據庫在處理向量數據時“查得慢”、“查不準”的痛點。技術選型考量點索引算法是采用HNSW圖算法查詢快但內存占用高、IVF倒排文件適合大規模數據、還是PQ乘積量化有損壓縮這需要根據數據規模、維度、查詢精度和延遲要求來權衡。通常HNSW適合中小規模、對延遲極度敏感的場景IVF-PQ適合超大規模數據集。持久化與可擴展性向量數據庫是否支持數據持久化到磁盤分布式擴展能力如何是Shared-Nothing架構嗎這對于生產環境的穩定性和成本至關重要。生態集成是否支持與主流AI框架如LangChain, LlamaIndex輕松集成是否提供了豐富的SDK和API這決定了開發的便利性。混合查詢能否在向量相似度搜索的同時高效地過濾標量屬性如日期、類別這是許多實際應用場景的剛需。注意事項不要盲目追求向量數據庫的極致檢索性能。在很多場景下如果向量數據規模在千萬級以內且需要與大量結構化數據關聯分析像Apache Doris這樣增強了向量能力的分析型數據庫可能是更簡潔、更經濟的選擇。只有當向量數據量極大十億級以上、檢索性能成為絕對瓶頸時才需要考慮引入獨立的、專業的向量數據庫并仔細評估其帶來的架構復雜性和運維成本。3.2 模型倉庫與全生命周期管理模型本身成為了核心的數據資產和產出物。模型倉庫Model Registry的作用類似于代碼倉庫Git但管理的是模型的版本、元數據、血緣和部署狀態。一個成熟的模型管理系統需要支持版本控制跟蹤模型代碼、訓練數據、超參數和權重的任意組合確保實驗的可復現性。元數據管理記錄模型的性能指標準確率、F1分數、訓練環境、數據血緣、創建者等信息。階段管理清晰定義模型從“開發”、“測試”、“預生產”到“生產”的生命周期狀態。部署與服務能夠一鍵將指定版本的模型部署到推理服務器如Triton或邊緣設備。MLflow和Kubeflow是這一領域的主流開源選擇。它們與CI/CD流水線、數據流水線的集成是實現MLOps機器學習運維的關鍵。3.3 智能化與自動化的數據流水線AI對數據流水線的要求遠超傳統的ETL。它需要處理更復雜的數據轉換如圖像增強、文本分詞、向量化并且對流水線的敏捷性、可觀測性和彈性有更高要求。演進趨勢從ETL到ELT再到ETLT數據先被快速加載Extract Load到數據湖然后在湖內進行轉換Transform最后將高質量的特征數據加載Load到特征庫或分析平臺進行訓練或服務。這種模式更適應AI場景下數據探索和迭代的靈活性。特征平臺的核心化特征工程是AI項目的成敗關鍵。特征平臺負責特征的定義、計算、存儲、服務和監控確保線上推理和線下訓練使用的是一致的特征數據避免“訓練-服務偏斜”。流水線即代碼與自動化編排使用Airflow、Dagster、Prefect等工具將數據流水線定義為代碼實現版本化、可測試和自動化調度。流水線需要能夠動態感知數據變化、模型性能衰減并觸發重新訓練或數據回填。4. 運維與成本AI負載下的新挑戰與應對策略AI工作流尤其是大模型訓練是眾所周知的“資源吞噬獸”。如何在高性能、高可用和可控成本之間取得平衡是數據基礎設施團隊面臨的最大挑戰。4.1 彈性計算與異構資源調度訓練任務對GPU資源的需求是爆發式且不連續的。固定的GPU集群要么在任務間隙大量閑置要么在任務高峰時排隊等待。應對策略云原生與Kubernetes利用Kubernetes的彈性伸縮能力結合集群自動伸縮器Cluster Autoscaler和GPU虛擬化技術實現訓練任務的按需創建和銷毀。任務排隊時自動擴容節點任務結束后自動縮容最大化資源利用率。Spot實例/搶占式實例對于容錯性較高的訓練任務支持從Checkpoint恢復可以大量使用云上的Spot實例AWS或搶占式實例GCP, Azure成本可能降低60%-90%。關鍵在于設計好檢查點保存策略和任務重啟機制。混合部署與分級調度將在線推理服務延遲敏感和離線訓練任務吞吐敏感混合部署在同一集群但通過Kubernetes的優先級、資源配額和節點親和性等策略進行隔離和調度實現資源“錯峰使用”。4.2 存儲成本優化與數據生命周期管理AI產生的數據量巨大且不同數據的熱度差異明顯。訓練用的原始數據集可能只需偶爾訪問而高頻迭代的模型Checkpoint和線上服務的特征數據則需要毫秒級響應。分層存儲策略熱層HotSSB或高性能云盤。存放正在被頻繁訪問的線上特征數據、高頻查詢的向量索引、以及當前活躍模型的參數。追求極致IOPS和低延遲。溫層Warm標準云硬盤或高性能對象存儲。存放近期的訓練數據、歷史特征版本、以及用于回溯分析的日志數據。平衡性能與成本。冷層Cold歸檔型對象存儲或磁帶。存放很少訪問的原始歷史數據、已完成項目的模型歸檔、合規要求的日志備份。成本最低。關鍵在于實現數據在不同存儲層之間的自動、策略化流動。例如可以基于數據的最后訪問時間、創建時間或業務標簽制定規則自動將數據從熱層遷移到溫層再到冷層。4.3 可觀測性與全鏈路追蹤當問題發生時在由數十個微服務和組件構成的復雜AI數據棧中定位根因如同大海撈針。傳統的監控指標CPU、內存已不夠用。需要構建的觀測能力數據質量監控監控特征數據的分布偏移、缺失率、異常值。一旦發現數據漂移立即告警因為這很可能導致模型性能下降。模型性能監控在線推理服務的預測延遲、吞吐量、錯誤率以及業務指標如推薦系統的點擊率、轉化率的實時監控。全鏈路追蹤一個用戶請求從進入應用到查詢特征到調用模型推理再到返回結果這整條路徑的延遲分解。使用OpenTelemetry等標準在Doris查詢、向量檢索、模型服務等各個組件中注入追蹤信息可以快速定位瓶頸是在數據庫查詢慢還是向量檢索耗時或是模型推理卡頓。資源利用率與成本歸因將云資源消耗計算、存儲、網絡精確地歸因到具體的業務部門、項目甚至個人實現成本的可視化和可控化。5. 未來展望Agent與自治化系統的基礎設施需求AI Agent的興起將數據基礎設施的挑戰推向了一個新高度。Agent不是單次調用的模型而是具有記憶、規劃和工具使用能力的持續運行的智能體。這對數據基礎設施提出了“狀態管理”和“實時交互”的新要求。可能的基礎設施演進方向Agent狀態數據庫需要一種新型的數據庫或存儲系統專門用于高效存儲和檢索Agent的長期記憶Long-term Memory、工作記憶Short-term Memory、執行歷史和工作流狀態。它需要支持復雜的、嵌套的、半結構化的狀態數據并能進行高效的相似性搜索例如“找到與我當前處境類似的歷史記憶”。實時數據流與復雜事件處理CEPAgent需要實時感知環境變化如市場數據、用戶行為流并做出即時決策。這要求底層的數據管道具備極低的端到端延遲并且流處理引擎能夠支持基于時間窗口和模式的復雜事件序列檢測。工具調用與API生態的集成層Agent需要通過調用各種工具搜索引擎、數據庫、業務API來完成任務。基礎設施需要提供一個安全、可靠、可觀測的“工具調用網關”對Agent的每一次外部調用進行認證、鑒權、限流、審計和結果規范化。這場由AI驅動的數據基礎設施演進本質上是數據棧為了適應一種全新的、更復雜、更動態的計算范式而進行的自我革新。它沒有終點而是一個隨著AI技術本身不斷迭代的持續過程。對于從業者而言理解從“存算分離”到“湖倉管一體”再到“智能數據服務層”和“AI原生組件”這條演進主線保持架構的開放性和組件的可插拔性遠比追逐某個單一的熱門技術更為重要。未來的贏家將是那些能夠最優雅、最高效、最經濟地讓數據在存儲、處理、AI模型和最終應用之間自由流動的平臺。