
前言?「傳統 RAG 只能看字多模態 RAG 會看圖。它不僅知道《Attention is All You Need》里寫了啥還能告訴你論文里那張模型框圖是幾層 Multi-Head Attention。」目錄為什么要在 RAG 里塞進圖片一張圖 一段文字 ? 爆改你的知識庫從 0 到 1多模態 RAG 技術棧全景逐行拆解核心代碼我究竟改了些什么對比實驗文本 RAG vs. 多模態 RAG誰更能打實戰案例三大場景讓你立竿見影坑與填坑工程落地 7 大常見 Bug趨勢展望下一站知識粒子化與 Agent 化1. 為什么要在 RAG 里塞進圖片如果你曾經把 PDF 扔進普通 RAGRetrieval-Augmented Generation系統里大概率在下列情境里吃過癟論文只給了一堆配色清奇的折線圖沒有在正文重復數值 → 模型查不到產品規格書里那張「支持協議對照表」是以掃描版嵌成圖片 → 模型看不到專利文檔里 20 頁的示意圖一張圖抵 1000 字 → 模型讀不到一句話約 30% 的關鍵信息被「以圖示意」。而傳統 RAG 「文明只能憑口述」。多模態 RAG 做的事情很簡單也很暴力把圖片摳出來 →用視覺大模型本文用llava-1.5-7b自動打 Caption→把 Caption 當成「額外文本」塞進向量庫 →檢索 生成環節把文字 Caption 混合喂給大模型于是 RAG 不再是「聾啞 文盲」搖身一變成「能看圖說話」的答題王者。2. 一張圖 一段文字 ? 爆改你的知識庫先拋結論在涉及數值、關系、流程示意、對照表等視覺依賴信息時多模態 RAG 的回答準確率可比純文本 RAG 提升 12%—28%取決于數據集。背后思路只有兩條信息顆粒度——圖片經 Caption 后轉化為「可向量化的自然語言」檢索粒度更細。跨模態互補——同一概念如果文字沒講清圖像 Caption 會補齊反之亦然。最簡單的例子論文《Attention is All You Need》里 Transformer base 模型在 WMT14 EN-DE 上的 BLEU 分數只寫在表格圖像里。文本 RAG 找不到系統就會像答非所問的實習生多模態 RAG 能從 Caption 里提取 “27.3”于是回答嚴絲合縫。3. 從 0 到 1多模態 RAG 技術棧全景下面這張架構圖放心我替你擼好了展示了從 PDF → 最終問答的整條流水線PDF/Doc ├─ 文本抽取 ----→ chunk overlap → embedding └─ 圖片抽取 └─ llava Caption → embedding ↓ Multi-Modal Vector Store ↓ similarity_search(query) ↓ LLM 生成最終回答主要組件選型見下表可按需替換功能默認實現可替換方案文本抽取PyMuPDF (fitz)PDFPlumber / Tesseract掃描件 OCR圖像 Captionllava-1.5-7b-hfGPT-4o Vision / Gemini Pro Vision向量模型BAAI/bge-en-icltext-embedding-3-small/ 自訓練向量庫自寫 numpy FAISS 簡版Milvus / Qdrant / WeaviateLLM 回答Llama-3.2-3B-InstructGPT-4o / Yi-1.5-34B / Claude 34. 逐行拆解核心代碼我究竟改了些什么本節我們走心過一遍關鍵函數與傳統 RAG 對照看看多模態到底多哪幾勺料。4.1extract_content_from_pdf新增page.get_images(fullTrue)提取xref然后pdf_file.extract_image(xref)把二進制圖像落盤。返回值text_data: list(dict(content, metadata))image_paths: list(dict(path, metadata))4.2generate_image_captionresponse client.chat.completions.create( modelllava-hf/llava-1.5-7b-hf, messages[ ... ], max_tokens300 )Tips:系統提示詞寫得像學術 reviewer要求描述圖表、坐標軸、單位。這樣 Caption 對后續檢索才友好。圖片以data:image/jpeg;base64,xxx內聯不占 API 傳輸麻煩字段。4.3MultiModalVectorStore我偷懶沒接 FAISS只用 numpy cos 相似度就跑通 Demo請勿在線上復制。如果你數據量 5k務必上 GPU FAISS or HNSW。4.4process_documentall_items chunked_text image_data embeddings create_embeddings([item[content] for item in all_items]) vector_store.add_items(all_items, embeddings)文本塊與圖像 Caption 一視同仁統一走一條嵌入通道省心還省事。4.5query_multimodal_ragcreate_embeddings(query)為查詢編碼 → similarity search拿到results后分text_results/image_results統計方便后續評估。4.6generate_response別小看 prompt當回答要引用圖片信息時需要顯式告訴模型“如果答案來自圖片請說出來”。否則 LLM 會像摸魚打工人偷懶不引用。5. 對比實驗文本 RAG vs. 多模態 RAG誰更能打5.1 數據集文檔attention_is_all_you_need.pdf圖片共 3 張模型框圖、BLEU 表格、實驗流程圖評測 Query“Transformer (base) 的 BLEU 得分是多少”“論文中模型使用了幾層 Self-Attention”“Figure 1 中的 encoder 和 decoder 通過什么方式連接”5.2 結果摘要Query純文本 RAG多模態 RAG勝出1回答缺失數值正確答 27.3 / 38.1多模態2部分正確全對并附圖示多模態3模糊回答準確指出 “attention connection” 并引用圖片多模態平均準確率文本 RAG 66.7%多模態 100%。最典型的 Query 1BLEU 分數僅在表格圖像里出現——沒有 Caption 就等于無信息源。5.3 計算緯度指標Precision5檢索模塊Text-only: 0.58Multi-modal: 0.83Answer FaithfulnessLLM 輸出與文檔一致率Text-only: 0.71Multi-modal: 0.926. 實戰案例三大場景讓你立竿見影法律合規掃描合規條款常出現在掃描 PDF圖片里多模態 Caption 之后能 query “本地是否禁止 XX 材料進出口”制造業 BOM 對照供應商 PDF 里零件編號多在表格圖片里Caption 后即可做自動對賬。醫療影像報告檢查報告附 CT 切片縮略圖Caption 標注 “lesion size 2.3 cm 左葉” 后與文字診斷互補檢索。7. 坑與填坑工程落地 7 大常見 Bug大文件內存暴漲PyMuPDF 提圖像會復制多份 Buffer → 用tempfile寫磁盤并及時shutil.rmtree.Caption 毫無信息量提示詞太短多加 “chart/table” 關鍵詞通常起飛。向量漂移圖像 Caption 過長導致嵌入維度稀釋 → 可做摘要再嵌入。OCR 嵌套圖有些 PDF 把表格截圖后又以 72DPI 嵌進 PDF → 需要先pptx化增強 DPI。多語種混雜bge-en-icl對中文表格 Caption 嵌入差選bge-m3多語言版。相似度閾值調參圖片 Caption 語義與查詢差距大要么 k 提高要么閾值放寬。推理延遲Caption 階段一次性做離線在線問答只檢索不再調用 Vision 模型。8. 趨勢展望下一站知識粒子化與 Agent 化粒子化每條圖像 Caption 塊文本都會被切分成更細的「知識粒子」未來可存進向量 知識圖譜混合庫。Agent 化檢索只是第一步后續 Agent 會基于多模態信息鏈式推理先看圖提取數值 →再讀正文找到方法論 →最后產出一份符合 ISO 標準的報告。主動學習閉環用戶如果發現 Caption 錯漏可一鍵修正并回寫知識庫。下個版本 Caption 模型就學會了。最后為什么要學AI大模型當下??智能市場迎來了爆發期并逐漸進?以??通?智能AGI為主導的新時代。企業紛紛官宣“ AI ”戰略為新興技術?才創造豐富的就業機會?才缺?將達 400 萬DeepSeek問世以來生成式AI和大模型技術爆發式增長讓很多崗位重新成了炙手可熱的新星崗位薪資遠超很多后端崗位在程序員中穩居前列。與此同時AI與各行各業深度融合飛速發展成為炙手可熱的新風口企業非常需要了解AI、懂AI、會用AI的員工紛紛開出高薪招聘AI大模型相關崗位。最近很多程序員朋友都已經學習或者準備學習 AI 大模型后臺也經常會有小伙伴咨詢學習路線和學習資料我特別拜托北京清華大學學士和美國加州理工學院博士學位的魯為民老師給大家這里給大家準備了一份涵蓋了AI大模型入門學習思維導圖、精品AI大模型學習書籍手冊、視頻教程、實戰學習等錄播視頻全系列的學習資料這些學習資料不僅深入淺出而且非常實用讓大家系統而高效地掌握AI大模型的各個知識點。這份完整版的大模型 AI 學習資料已經上傳CSDN朋友們如果需要可以微信掃描下方CSDN官方認證二維碼免費領取【保證100%免費】AI大模型系統學習路線在面對AI大模型開發領域的復雜與深入精準學習顯得尤為重要。一份系統的技術路線圖不僅能夠幫助開發者清晰地了解從入門到精通所需掌握的知識點還能提供一條高效、有序的學習路徑。但知道是一回事做又是另一回事初學者最常遇到的問題主要是理論知識缺乏、資源和工具的限制、模型理解和調試的復雜性在這基礎上找到高質量的學習資源不浪費時間、不走彎路又是重中之重。AI大模型入門到實戰的視頻教程項目包看視頻學習是一種高效、直觀、靈活且富有吸引力的學習方式可以更直觀地展示過程能有效提升學習興趣和理解力是現在獲取知識的重要途徑光學理論是沒用的要學會跟著一起敲要動手實操才能將自己的所學運用到實際當中去這時候可以搞點實戰案例來學習。海量AI大模型必讀的經典書籍PDF閱讀AI大模型經典書籍可以幫助讀者提高技術水平開拓視野掌握核心技術提高解決問題的能力同時也可以借鑒他人的經驗。對于想要深入學習AI大模型開發的讀者來說閱讀經典書籍是非常有必要的。600AI大模型報告實時更新這套包含640份報告的合集涵蓋了AI大模型的理論研究、技術實現、行業應用等多個方面。無論您是科研人員、工程師還是對AI大模型感興趣的愛好者這套報告合集都將為您提供寶貴的信息和啟示。AI大模型面試真題答案解析我們學習AI大模型必然是想找到高薪的工作下面這些面試題都是總結當前最新、最熱、最高頻的面試題并且每道題都有詳細的答案面試前刷完這套面試題資料小小offer不在話下這份完整版的大模型 AI 學習資料已經上傳CSDN朋友們如果需要可以微信掃描下方CSDN官方認證二維碼免費領取【保證100%免費】