構(gòu)化記憶系統(tǒng):實現(xiàn)AI智能體超長視頻深度理解與推理)
1. 從“看視頻”到“理解視頻”智能體長視頻推理的挑戰(zhàn)與機遇想象一下你面前有一段長達一小時的監(jiān)控錄像或者是一部沒有字幕的紀(jì)錄片。你的任務(wù)是找出其中所有涉及“人物A進入房間放下物品然后與人物B交談”的片段并推斷他們交談的可能內(nèi)容。對于人類來說這需要集中注意力記住關(guān)鍵人物、場景和動作的先后順序并在大腦中構(gòu)建一個動態(tài)的“故事線”。但對于現(xiàn)有的AI模型尤其是依賴大語言模型LLM的智能體Agent來說這幾乎是一個不可能完成的任務(wù)。原因很簡單“記憶”太短“理解”太淺。這就是“Bridging Modalities, Spanning Time: Structured Memory for Ultra-Long Agentic Video Reasoning”這個標(biāo)題所直指的核心痛點。它不是一個簡單的視頻分類或動作識別任務(wù)而是要求AI智能體像人一樣對超長視頻進行主動的、目標(biāo)驅(qū)動的、跨模態(tài)的深度推理。這里的“超長”Ultra-Long可能意味著數(shù)十分鐘甚至數(shù)小時遠超當(dāng)前主流視頻理解模型通常處理幾秒到幾分鐘片段和LLM上下文窗口通常幾萬到幾十萬token對應(yīng)視頻幀的token化表示會迅速耗盡的處理極限。“Bridging Modalities”指的是彌合視覺、音頻、文本如OCR字幕、場景文本等多種模態(tài)信息之間的鴻溝。一段視頻不僅僅是圖像序列還包含聲音、對話、屏幕上的文字等信息。智能體需要將它們?nèi)诤铣梢粋€統(tǒng)一的理解。“Spanning Time”則是對抗時間遺忘的關(guān)鍵。智能體必須在整個視頻的時間跨度內(nèi)維持對早期事件的記憶并將其與后續(xù)事件關(guān)聯(lián)起來以支持復(fù)雜的因果或邏輯推理。而這一切的基石就是“Structured Memory”結(jié)構(gòu)化記憶。這不再是簡單地將所有視頻幀特征壓縮成一個向量而是構(gòu)建一個動態(tài)的、可查詢的、富含關(guān)系的記憶圖譜Memory Graph。這讓我想起了人類大腦的海馬體它不僅僅存儲信息更重要的是組織信息之間的時空和語義關(guān)聯(lián)。最近網(wǎng)絡(luò)熱議的“Agentic RAG”智能體檢索增強生成研究方向其核心思想也是讓智能體主動、迭代地從外部知識庫中檢索信息以完成任務(wù)。將視頻本身視為一個動態(tài)的、多模態(tài)的“知識庫”為智能體構(gòu)建一個專為長視頻理解設(shè)計的“記憶系統(tǒng)”正是“Agentic Video Reasoning”的精髓所在。本文我將結(jié)合最新的研究趨勢如MAGIC-Video、Memory Graph等概念和工程實踐深入拆解如何為AI智能體構(gòu)建一個能夠“橋接模態(tài)、跨越時間”的結(jié)構(gòu)化記憶系統(tǒng)以實現(xiàn)真正實用的超長視頻推理能力。無論你是從事多模態(tài)AI研究的工程師還是希望將視頻分析能力集成到產(chǎn)品中的開發(fā)者這篇文章都將為你提供一個從理論到實踐的系統(tǒng)性視角。2. 解構(gòu)核心挑戰(zhàn)為什么長視頻推理如此之難在深入技術(shù)方案之前我們必須先厘清阻礙當(dāng)前技術(shù)實現(xiàn)超長視頻推理的具體障礙。這些障礙并非孤立存在而是相互交織共同構(gòu)成了一個復(fù)雜的挑戰(zhàn)網(wǎng)絡(luò)。2.1 信息過載與計算成本爆炸一段1080p、30fps的一小時視頻包含108,000幀原始圖像。即使使用高效的視覺編碼器如ViT將每幀壓縮成一個特征向量其序列長度也遠超任何Transformer模型的常規(guī)處理能力。直接輸入LLM進行端到端處理在計算上是不可行的。更不用說高幀率下連續(xù)幀之間存在極高的信息冗余。因此首要挑戰(zhàn)是如何對海量視頻數(shù)據(jù)進行高效且無損關(guān)鍵信息的壓縮與摘要。粗暴的均勻采樣會丟失重要瞬時動作如眨眼、手勢變化而簡單的關(guān)鍵幀檢測又可能破壞動作的連續(xù)性。2.2 模態(tài)異構(gòu)與對齊難題視頻是天然的多模態(tài)數(shù)據(jù)流視覺流物體、場景、人物、動作、姿態(tài)。音頻流環(huán)境音、音樂、語音內(nèi)容。文本流自動語音識別ASR產(chǎn)生的字幕、屏幕內(nèi)的OCR文本如新聞標(biāo)題、路牌、可能存在的元數(shù)據(jù)標(biāo)簽。每個模態(tài)都有其獨特的特征空間和語義粒度。例如視覺特征擅長描述“是什么”一個杯子而ASR文本擅長描述“說什么”“請把杯子遞給我”。智能體需要理解“說‘遞杯子’的人”和“畫面中拿起杯子的手”指的是同一個動作事件。這種跨模態(tài)的細(xì)粒度對齊尤其是在沒有顯式標(biāo)注的情況下是構(gòu)建高質(zhì)量結(jié)構(gòu)化記憶的前提。2.3. 長程依賴與因果推理視頻推理的核心價值往往在于理解時間線上的因果或邏輯關(guān)系。例如在偵探片中需要關(guān)聯(lián)“角色A在10分鐘時偷聽到對話”和“角色B在45分鐘時采取的異常行動”。這要求記憶系統(tǒng)不僅能存儲離散的事件片段還能維護和檢索事件之間的時序關(guān)系、因果鏈甚至假設(shè)性關(guān)聯(lián)。傳統(tǒng)的RNN或LSTM存在梯度消失問題難以捕捉超長程依賴而Transformer的自注意力機制雖然理論上能捕捉任意長距離依賴但其計算復(fù)雜度隨序列長度平方增長且需要模型在訓(xùn)練時就看到過類似長度的模式這對于超長視頻來說是不現(xiàn)實的。2.4. 智能體的主動性與目標(biāo)導(dǎo)向“Agentic”一詞意味著智能體不是被動地處理完整個視頻再回答問題而是應(yīng)該像偵探一樣帶著任務(wù)Goal去主動審視視頻。例如任務(wù)可能是“找出所有可能導(dǎo)致事故的安全隱患”。智能體需要能根據(jù)當(dāng)前的理解主動決定“看哪里”和“回想什么”。它可能需要反復(fù)跳轉(zhuǎn)到視頻的不同部分對比觀察或者聚焦于某個可疑的細(xì)節(jié)。這就要求記憶系統(tǒng)支持高效的、基于內(nèi)容的檢索而不僅僅是順序掃描。這與當(dāng)前熱門的“Agentic RAG”思想完全吻合即智能體循環(huán)執(zhí)行“規(guī)劃-檢索-執(zhí)行”的步驟只不過檢索源是內(nèi)部的結(jié)構(gòu)化記憶而非外部知識庫。3. 結(jié)構(gòu)化記憶藍圖從特征序列到動態(tài)圖譜面對上述挑戰(zhàn)一個簡單的特征池化Pooling或遞歸網(wǎng)絡(luò)顯然力不從心。我們需要一個更具表達力的記憶表征。結(jié)構(gòu)化記憶的核心思想是將連續(xù)的視頻流解構(gòu)為一個由“記憶單元”及其“關(guān)系”構(gòu)成的動態(tài)圖譜Graph。3.1 記憶單元的構(gòu)建多粒度的事件切片首先我們需要定義記憶的基本單位。直接使用每一幀作為單元會導(dǎo)致圖譜節(jié)點過多關(guān)系稀疏。更有效的方法是進行多粒度的時序分割與語義聚合。底層視覺-語言令牌Tokens使用強大的視覺編碼器如CLIP的ViT和音頻/文本編碼器將短片段如1-2秒編碼為密集特征。這些特征作為最細(xì)粒度的原材料。中層事件片段Events這是記憶圖譜的核心節(jié)點。通過時序動作檢測、場景分割或基于內(nèi)容的聚類算法將連續(xù)的令牌聚合為具有語義意義的事件片段。例如“人物走近桌子”、“拿起電話”、“開始通話”可以被劃分為三個事件節(jié)點。每個節(jié)點包含多模態(tài)特征嵌入該時間段內(nèi)視覺、音頻、文本特征的聚合如均值池化或注意力加權(quán)。語義描述利用視頻描述模型如Video-LLaMA為該片段生成一個簡短的文本描述如“A man in a blue shirt picks up a cell phone”。時序邊界起始和結(jié)束時間戳。關(guān)鍵幀索引指向最具代表性的1-2幀。高層場景或章節(jié)Scenes/Chapters將相關(guān)的事件節(jié)點進一步聚類形成更大的敘事單元。例如將“進入辦公室”、“寒暄”、“坐下開會”等一系列事件歸入“會議開始”這個場景節(jié)點。這為宏觀推理提供了上下文。實操心得事件分割的穩(wěn)定性完全依賴無監(jiān)督聚類進行事件分割在不同視頻上效果可能不穩(wěn)定。一個實用的技巧是結(jié)合有監(jiān)督的動作識別模型在Kinetics等數(shù)據(jù)集上預(yù)訓(xùn)練輸出的類別概率作為輔助信號來引導(dǎo)聚類邊界。例如當(dāng)“握手”動作的概率持續(xù)高置信度時這很可能是一個獨立事件的中心。3.2 關(guān)系邊的定義連接時空與語義節(jié)點之間需要連邊以表示各種關(guān)系從而形成“記憶圖譜”。時序關(guān)系最基本的關(guān)系。定義“前驅(qū)-后繼”邊形成視頻的主時間線。可以進一步區(qū)分緊密連接相鄰事件和跳躍連接同一場景內(nèi)但不直接相鄰的事件。空間共現(xiàn)關(guān)系在同一事件或場景中出現(xiàn)的實體人物、物體之間建立邊。例如“人物A”和“杯子”在“拿起杯子”事件中共同出現(xiàn)。這需要實體檢測與跟蹤技術(shù)的支持。語義相似關(guān)系計算事件節(jié)點特征之間的余弦相似度為高度相似但時間上不連續(xù)的事件建立邊。這有助于發(fā)現(xiàn)重復(fù)模式或主題呼應(yīng)。例如視頻中多次出現(xiàn)的“打電話”事件可以被關(guān)聯(lián)起來。因果/邏輯關(guān)系這是最高級也是最難自動構(gòu)建的關(guān)系。可以通過以下方式近似利用常識知識庫將事件描述輸入到LLM中詢問“事件X通常會導(dǎo)致什么”或“事件Y的可能原因是什么”利用LLM的推理能力生成假設(shè)性的因果邊。基于動詞的推理分析事件描述中的動詞。例如“點燃”事件A和“爆炸”事件B之間很可能存在因果關(guān)系。可以構(gòu)建一個動詞-結(jié)果映射詞典來輔助。3.3 圖譜的存儲與更新外掛記憶體這個動態(tài)增長的記憶圖譜不能完全存儲在LLM有限的上下文窗口中。它需要作為一個外掛的、可持久化訪問的記憶體。通常的架構(gòu)是圖數(shù)據(jù)庫/向量數(shù)據(jù)庫將每個事件節(jié)點及其特征向量存儲在向量數(shù)據(jù)庫中便于后續(xù)的相似性檢索。同時節(jié)點之間的關(guān)系邊存儲在圖數(shù)據(jù)庫中支持復(fù)雜的圖遍歷查詢?nèi)纭罢页鏊信c人物A相關(guān)且發(fā)生在會議室場景中的事件”。內(nèi)存索引在LLM的上下文中只維護一個當(dāng)前“工作記憶”區(qū)包含與當(dāng)前任務(wù)最相關(guān)的少數(shù)幾個節(jié)點及其關(guān)鍵信息。當(dāng)需要更多上下文時LLM智能體生成一個查詢?nèi)ネ鈷斓挠洃涹w中檢索相關(guān)的節(jié)點和子圖然后加載到工作記憶中進行推理。這種架構(gòu)完美契合了“Agentic”的工作模式智能體擁有一個龐大的、結(jié)構(gòu)化的長期記憶圖譜并能夠主動地、按需地從其中提取信息塊到有限的“思考內(nèi)存”中。4. 實現(xiàn)路徑MAGIC-Video 范式與智能體工作流近年來像MAGIC-Video這類研究為我們提供了寶貴的范式參考。雖然具體架構(gòu)可能不同但其核心思想是共通的分層處理、記憶構(gòu)建、智能體控制。下面我結(jié)合一個具體的實現(xiàn)思路來拆解如何搭建這樣一個系統(tǒng)。4.1 階段一離線的視頻結(jié)構(gòu)化與記憶圖譜構(gòu)建這個階段在用戶查詢之前完成將原始視頻預(yù)處理成可查詢的記憶圖譜。多模態(tài)特征提取視覺使用像InternVideo或VideoMAE這類強大的視頻基礎(chǔ)模型提取片段級如每秒1個片段的視覺特征。同時使用目標(biāo)檢測如YOLO和跟蹤器如ByteTrack獲取視頻中所有實體人、車、物體的軌跡框和ID。音頻使用Whisper進行自動語音識別ASR得到帶時間戳的轉(zhuǎn)錄文本。同時可以提取音頻事件特征如笑聲、掌聲、警報聲。文本對視頻幀進行OCR提取屏幕文本。時序事件檢測與分割將視覺特征序列輸入一個輕量化的時序動作分割模型如TCN或ASRF預(yù)測出動作變化的邊界。也可以采用無監(jiān)督的變更點檢測算法。結(jié)合ASR的靜音段和說話人轉(zhuǎn)換點作為音頻模態(tài)的事件邊界提示。將多模態(tài)的邊界信號融合得到最終的事件分割點。每個段落的特征由段內(nèi)所有幀特征的加權(quán)平均得到。事件節(jié)點描述生成對于每個事件段落拼接以下信息作為提示輸入一個多模態(tài)大語言模型如GPT-4V, LLaVA-NeXT-Video該事件的關(guān)鍵幀1-2張。該時間段內(nèi)的ASR文本。該時間段內(nèi)出現(xiàn)的主要實體列表從跟蹤結(jié)果獲得。提示詞設(shè)計為“請用一句簡潔的話描述從時間 [start] 到 [end] 發(fā)生的核心事件重點描述人物的動作和交互。” 從而獲得結(jié)構(gòu)化的語義描述。圖譜構(gòu)建與存儲將每個事件節(jié)點包含多模態(tài)特征向量、文本描述、時間戳、實體列表存入向量數(shù)據(jù)庫如ChromaDB Milvus。根據(jù)時間戳自動建立時序邊。計算事件描述文本的嵌入向量通過相似度檢索如cosine similarity 0.8建立語義相似邊。將實體列表與事件節(jié)點關(guān)聯(lián)在同一事件中共現(xiàn)的實體之間建立空間共現(xiàn)邊。所有這些關(guān)系存入一個圖數(shù)據(jù)庫如Neo4j或直接用關(guān)系型數(shù)據(jù)庫表表示。避坑指南描述生成的幻覺問題MLLM在生成描述時可能出現(xiàn)“幻覺”描述畫面中不存在的內(nèi)容。為了緩解這個問題可以采用檢索增強描述的方法先從事件的關(guān)鍵幀和ASR文本中通過關(guān)鍵詞提取或?qū)嶓w鏈接找出高置信度的實體和動作詞將這些作為“事實錨點”放入給MLLM的提示詞中約束其生成范圍。例如“已知畫面中有[男人 杯子 桌子]音頻中提到‘口渴’請生成描述。”4.2 階段二在線的智能體推理循環(huán)當(dāng)用戶提出一個查詢Query時智能體開始工作。這是一個典型的“規(guī)劃-檢索-執(zhí)行-反思”Plan-Retrieve-Execute-Reflect的Agentic循環(huán)。規(guī)劃與查詢分解LLM智能體的大腦首先分析用戶復(fù)雜的查詢。例如查詢是“找出視頻中所有討論項目預(yù)算的對話片段并總結(jié)每個片段中提出的主要風(fēng)險。”LLM會規(guī)劃出需要執(zhí)行的子任務(wù)子任務(wù)1識別所有包含“預(yù)算”、“成本”、“資金”等關(guān)鍵詞的對話片段基于ASR文本檢索。子任務(wù)2對于每個片段理解對話上下文提取出“風(fēng)險”相關(guān)的陳述。子任務(wù)3將提取出的風(fēng)險信息按主題歸類匯總。基于子任務(wù)LLM會生成針對記憶圖譜的檢索查詢。例如對于子任務(wù)1生成查詢向量可能是“討論預(yù)算 financial budget conversation”的文本嵌入。從圖譜中主動檢索智能體將生成的查詢向量發(fā)送到向量數(shù)據(jù)庫進行相似性搜索召回Top-K個相關(guān)的事件節(jié)點。不僅如此智能體還可以進行圖遍歷檢索。例如它先找到提到“預(yù)算”的事件節(jié)點然后通過“同一說話人”或“前后5分鐘內(nèi)”的關(guān)系邊找到與之相鄰的其他事件節(jié)點以獲取更完整的對話上下文。檢索到的節(jié)點及其局部圖譜關(guān)聯(lián)的邊和鄰居節(jié)點被加載到LLM的上下文中成為當(dāng)前的“工作記憶”。執(zhí)行與答案生成LLM基于工作記憶中豐富的、結(jié)構(gòu)化的信息執(zhí)行推理任務(wù)。例如它現(xiàn)在能看到“事件23人物A說‘我們預(yù)算可能超支’事件24人物B回應(yīng)‘主要是采購風(fēng)險’事件25人物A提到‘供應(yīng)商不穩(wěn)定’...”。LLM綜合這些信息生成對當(dāng)前子任務(wù)的回答。對于子任務(wù)2它可能輸出“在 15:30-16:00 時段討論提出的主要風(fēng)險是1. 采購風(fēng)險供應(yīng)商不穩(wěn)定2. 市場波動導(dǎo)致原材料價格上漲。”反思與迭代智能體可以評估當(dāng)前答案的完整性或可信度。如果它發(fā)現(xiàn)檢索到的上下文不足以判斷某個風(fēng)險的具體影響它可以發(fā)起新一輪的、更精準(zhǔn)的檢索。例如它可能生成一個新的查詢“查找在‘供應(yīng)商不穩(wěn)定’這個風(fēng)險被提及之后是否有討論應(yīng)對措施的片段。” 然后再次從圖譜中檢索并將新結(jié)果融入工作記憶更新或完善其答案。這個循環(huán)可以持續(xù)進行直到智能體認(rèn)為答案滿足要求或者達到預(yù)設(shè)的迭代次數(shù)。5. 工程實踐中的關(guān)鍵決策與優(yōu)化策略將上述藍圖轉(zhuǎn)化為實際可運行的系統(tǒng)會遇到許多工程上的抉擇點。以下是我在類似項目中的一些經(jīng)驗總結(jié)。5.1 模態(tài)融合的時機選擇早融合 vs. 晚融合早融合Early Fusion在特征提取階段就將多模態(tài)信號如視覺、音頻融合成一個統(tǒng)一的特征向量。優(yōu)點是模型可以直接學(xué)習(xí)跨模態(tài)關(guān)聯(lián)可能獲得更優(yōu)的聯(lián)合表征。缺點是靈活性差一旦訓(xùn)練完成很難單獨更新某個模態(tài)的編碼器且計算圖復(fù)雜。晚融合Late Fusion每個模態(tài)獨立處理生成各自的特征和描述在記憶節(jié)點層面或LLM推理層面再進行融合。這正是我們上述藍圖采用的方式。其最大優(yōu)勢在于模塊化和靈活性。你可以隨時更換更先進的ASR模型或視覺編碼器而無需重新訓(xùn)練整個系統(tǒng)。LLM也擅長在文本層面對來自不同來源的描述進行整合。對于工程實現(xiàn)我強烈推薦晚融合策略它更易于維護和迭代。5.2 圖譜更新的策略靜態(tài) vs. 動態(tài)靜態(tài)圖譜在離線階段一次性構(gòu)建完整圖譜。適用于視頻內(nèi)容不變、查詢多樣的場景如影視資料庫分析。優(yōu)點是構(gòu)建一次可服務(wù)無數(shù)次查詢效率高。動態(tài)圖譜在智能體推理過程中根據(jù)新的發(fā)現(xiàn)或假設(shè)動態(tài)地創(chuàng)建新的節(jié)點或關(guān)系。例如智能體推斷“人物A和人物B可能在密謀”即使原視頻沒有明確標(biāo)簽它也可以在記憶圖譜中創(chuàng)建一個“疑似密謀”的假設(shè)性節(jié)點并鏈接到相關(guān)事件。這更接近人類的推理過程但對系統(tǒng)的邏輯一致性要求極高。實用建議初期實現(xiàn)靜態(tài)圖譜為主輔以動態(tài)標(biāo)注。即圖譜主干離線構(gòu)建允許智能體在推理時為節(jié)點添加臨時性的“注釋”或“標(biāo)簽”這些動態(tài)內(nèi)容保存在當(dāng)次會話的緩存中而不回寫到主圖譜以控制復(fù)雜度。5.3 處理極端長度視頻分層檢索與摘要代理對于數(shù)小時甚至更長的視頻如全天候監(jiān)控即使構(gòu)建了圖譜直接進行全局檢索也可能效率低下。需要引入分層機制第一層視頻章節(jié)摘要。先用一個輕量模型或規(guī)則如根據(jù)場景切換、長時間靜默將視頻分割成大的章節(jié)如每10-30分鐘一章并為每個章節(jié)生成一個高度概括的摘要例如“上午會議討論Q1財報”、“下午外勤客戶現(xiàn)場勘查”。第二層智能體路由。用戶查詢到來時智能體先查閱章節(jié)摘要判斷哪些章節(jié)可能與查詢最相關(guān)。例如查詢“查找所有關(guān)于客戶需求的討論”智能體通過摘要判斷“下午外勤”章節(jié)概率最大。第三層精細(xì)化圖譜檢索。智能體只加載相關(guān)章節(jié)的詳細(xì)記憶圖譜進行精細(xì)化檢索和推理。這大大縮小了每次需要處理的數(shù)據(jù)范圍提升了效率。5.4 評估體系的構(gòu)建超越準(zhǔn)確率如何評估一個超長視頻推理系統(tǒng)的優(yōu)劣傳統(tǒng)的分類準(zhǔn)確率、mAP等指標(biāo)不再適用。需要設(shè)計一套綜合評估體系事實準(zhǔn)確性智能體提取的事件、實體、關(guān)系是否與視頻內(nèi)容相符可以人工標(biāo)注一部分關(guān)鍵信息作為驗證集。推理深度系統(tǒng)是否能回答需要多步推理的問題可以設(shè)計分層次的問題集從簡單的事實查找“誰在說話”到因果推斷“他為什么生氣”再到假設(shè)性預(yù)測“如果X沒發(fā)生Y會怎樣”。檢索效率平均每次查詢需要檢索多少個記憶節(jié)點迭代多少次這反映了系統(tǒng)的“思考成本”。人工偏好評估對于復(fù)雜的開放式問題讓人類評估員對比不同系統(tǒng)輸出的答案從相關(guān)性、完整性、邏輯性、簡潔性等多個維度進行評分。這是目前衡量這類系統(tǒng)最終效果的最可靠方法。構(gòu)建一個能夠“橋接模態(tài)、跨越時間”的結(jié)構(gòu)化記憶系統(tǒng)是實現(xiàn)強大Agentic視頻推理的必經(jīng)之路。這條路充滿挑戰(zhàn)從多模態(tài)對齊的細(xì)粒度要求到長序列建模的計算瓶頸再到智能體工作流的設(shè)計每一步都需要精心考量。然而其回報也是巨大的。它意味著AI不再僅僅是“看到”視頻而是真正開始“理解”視頻中隨時間展開的復(fù)雜敘事。從安防監(jiān)控的事后分析、教育視頻的智能輔導(dǎo)到影視內(nèi)容的深度挖掘這項技術(shù)有著廣闊的應(yīng)用前景。從我個人的實踐來看啟動這類項目的最佳方式是從一個具體的、定義清晰的垂直場景開始例如“會議錄像的要點自動生成”采用晚融合、靜態(tài)圖譜的實用架構(gòu)快速構(gòu)建原型然后在真實數(shù)據(jù)和查詢的反饋循環(huán)中逐步迭代加入更復(fù)雜的推理能力和動態(tài)特性。記住核心始終是服務(wù)于那個“智能體”讓它能有效地在記憶的海洋中找到照亮答案的燈塔。