
文章介紹了20個大模型本體概念幫助產品經理在AI產品決策時不再依賴模糊判斷而是基于精準認知。內容涵蓋了模型分類、開源與閉源模型、本地與云端部署、基礎模型與對話模型、推理模型、Token、上下文窗口、幻覺、溫度參數、系統提示詞、思維鏈、少樣本提示、零樣本提示、預訓練、監督微調、基于人類反饋的強化學習、量化、參數量、基準評測、涌現能力等關鍵知識點。文章強調了大模型知識的核心價值在于幫助產品經理在選型、功能設計、成本估算等決策環節不再依賴他人翻譯而是基于自身理解做出明智決策。1、模型的分類產品經理在規劃AI功能時直覺反應往往是調個大模型API就完事了。但實際到了技術評審你會發現處理文字、圖片、語音、視頻需要的是完全不同的模型。大模型處理的信息類型被稱為 模態。不同模態對應不同類型的模型這是產品選型的起點。LLM也叫純文本語言模型只處理文本輸入和文本輸出。GPT-5.4對話、Claude問答均屬此類。絕大多數產品中調用的API是LLM。多模態模型 同時處理文本和圖片部分支持視頻和音頻。GPT-5.4、Gemini 3.1、Claude 4.6 Sonnet是多模態模型。產品中需要識別圖片內容、分析截圖或處理文檔掃描件必須調用多模態模型純文本LLM無法接收圖片輸入。文生圖模型 接受文本輸入輸出圖片。Stable Diffusion、DALL-E 3、Midjourney屬此類。這是與LLM完全獨立的模型類型底層架構不同不能混用API。語音模型 分三類。TTS是文字轉語音ASR是語音轉文字S2S是端到端語音對話。產品中的語音交互功能通常需要單獨集成這類模型LLM本身不處理音頻。視頻生成模型 接受文字或圖片輸入生成視頻。Sora、可靈、即夢屬此類。當前生成延遲高、幀率和分辨率有限制商業化產品中使用場景集中在內容創作方向。一個需要同時處理文字、圖片、語音的產品意味著至少三套模型接入方案。三套接入復雜度和三套計費邏輯規劃階段如果沒有識別出來工期預估一定出錯。2、開源閉源模型做選型評估時第一個要回答的問題是數據能不能出公司。這個問題的答案直接決定你走閉源還是開源路線。閉源模型 的權重不對外公開通過API訪問按調用量計費。GPT-4系列、Claude 3系列、Gemini Ultra屬此類。數據經API傳輸會經過第三方服務器處理。適合快速上線的場景無需自行維護模型基礎設施。開源模型 的權重公開發布可下載到本地服務器運行。Llama 3、Qwen 2.5、DeepSeek-V2屬此類。數據不離開自有基礎設施滿足數據不出境的合規要求。需要團隊自行維護GPU算力運維成本由自己承擔。兩者的核心差異不是模型能力是 數據控制權和成本結構。閉源模型的使用成本隨調用量線性增長開源模型的成本集中在GPU采購和運維邊際成本低。金融、醫療、政務類產品多數選擇開源自部署路線根本原因是監管層對數據出境有明確限制。還有一種中間態叫開源不開權重代碼和架構公開但模型權重受商業許可約束不能自由商用。選型時需要仔細閱讀license文件不能只看GitHub上的開源標簽。評估選型方案前先跟法務確認數據合規邊界這一步決定了后面所有技術方案的可選范圍。3、模型本地云端部署方案評審階段部署位置是繞不開的問題。部署在哪直接決定了成本結構、延遲水平和數據安全等級。云端部署 是模型運行在云服務商的服務器上產品通過網絡API調用。延遲受網絡條件影響通常100ms到2秒不等。按Token數量或API調用次數計費。這是當前絕大多數AI產品的接入方式上手成本最低。端側部署 是模型運行在用戶的設備上比如手機芯片、PC的NPU。數據不通過網絡傳輸延遲低無網絡也能運行。受設備算力限制能運行的模型參數量通常在7B以下。蘋果的Apple Intelligence、手機廠商的端側AI功能均屬此類。私有化部署 是企業采購或租用GPU服務器在自有機房或私有云上運行開源模型。數據不出內網滿足最嚴格的合規要求但GPU采購和運維成本高。三種部署方式的決策維度是成本、延遲、數據安全三者的權衡。方案評審階段你必須先排好這三個維度的優先級順序再選擇部署方案。把架構決策完全交給工程團隊會導致后期因合規問題推倒重來。4、基礎模型 vs 對話模型這是最容易混淆的概念對混淆后直接導致選型方向出錯。基礎模型Base Model 僅經過大規模語料預訓練學到的能力是根據上下文預測下一個詞。這類模型不具備遵循指令的能力直接輸入幫我寫一份郵件輸出是按照訓練數據里的概率分布續寫文字不一定產出郵件格式內容。基礎模型不適合直接面向最終用戶。對話模型Chat/Instruct Model 在基礎模型之上經過指令微調和RLHF對齊這兩個概念后面展開具備理解和遵循用戶指令的能力。GPT-4-turbo、Claude 3 Opus、Qwen-72B-Instruct均是對話版本。調用API時選擇的版本后綴通常是 -instruct、-chat 或 -turbo對應的就是對話模型。你通過API調用的幾乎全部是對話模型。基礎模型更多用于需要最大化生成多樣性的場景比如生成訓練數據、創意實驗。看模型文檔時直接跳到對話版本的章節即可。5、推理模型同樣一個復雜分析任務普通對話模型經常漏掉關鍵邏輯推理模型的準確率明顯更高但API賬單也跟著翻了好幾倍。推理模型 是2024年以來出現的新范式與普通對話模型存在本質區別。普通對話模型在接收用戶輸入后直接生成回復。推理模型在生成最終回復前會執行一段內部的逐步思考過程這個過程通常以隱藏的思維鏈形式存在對用戶不可見但計入Token消耗。代表性模型有OpenAI的o1和o3系列Anthropic的Claude 3.7 Sonnet擴展思考模式阿里的Qwen3系列。數學計算、邏輯推理、代碼生成、復雜分析類任務推理模型的準確率顯著高于普通對話模型。定性的文字類任務摘要、改寫、翻譯普通對話模型夠用用推理模型只是增加延遲和成本。你的核心決策點是用戶的任務是否需要多步驟推導。客服問答不需要推理模型合同風險分析需要推理模型。這個判斷不做清楚產品成本模型就會出現結構性錯誤。6、TokenSystem Prompt明明不長但每次API調用費用就是居高不下。問題可能出在Token的計算方式上。Token 是大模型處理文本的最小單位不等于字或詞。英文中一個Token平均對應約0.75個單詞。中文中一個漢字通常對應1到2個Token具體取決于分詞器。處理同樣信息密度的文本中文消耗的Token數量高于英文成本更高這個差異在高頻調用場景下累積效果顯著。Token對你有兩個直接影響。第一個是計費。 主流大模型API按輸入Token和輸出Token分開計費輸出Token通常比輸入Token更貴。寫一個功能的System Prompt加上用戶輸入再加上模型回復三者合計的Token數量決定單次調用成本。System Prompt過長超過3000 Token時每次調用都會重復計費這部分高頻場景下累計成本不可忽視。第二個是內容限制。 模型的上下文窗口限制了單次能處理的Token總量見概念7。長文檔處理時文檔內容必須被切分為不超過上下文窗口的片段分批處理這是產品架構設計的硬約束。?? Token · 單次成本基線上線前先算清楚單次調用的Token消耗System Prompt 平均用戶輸入 平均輸出三項乘以單價這就是你的單次成本基線。7、Context Window用戶上傳一份50頁的PDF要求總結模型只總結了前10頁。不是模型偷懶是Context Window不夠了。Context Window 是模型在單次推理中能同時處理的最大Token數量包括輸入和輸出的總和。這個參數直接決定產品能做什么。當Context Window是4K Token時模型大約能處理3000字中文文本。128K Token時能處理約10萬字。當前部分模型已達到1M Token的上下文長度對應約75萬字的處理能力。產品中的典型約束場景用戶上傳長文檔要求摘要超過Context Window的內容會被截斷模型看不到。長對話中歷史消息超出Context Window后模型開始遺忘早期內容。代碼庫分析時Context Window限制了能同時分析的代碼文件數量。更大的Context Window通常意味著更高的單次API費用因為推理計算量與輸入Token數成正比。設計功能時先明確典型場景下的Token規模據此選擇合適的模型版本而不是默認選最大上下文的版本再考慮成本。8、Hallucination模型生成的內容讀起來很專業引用了數據源和出處但一查發現數據源根本不存在。這就是幻覺。Hallucination 是模型生成聽起來合理但實際上錯誤或虛構內容的現象。這不是模型的誠信問題是模型生成機制的固有特性。模型的生成過程是基于統計概率預測下一個Token沒有驗證機制核查生成內容是否符合事實。幻覺的高風險場景集中在三類生成具體數字引用來源、統計數據、金額生成人名和職位信息可能混淆不同人物的屬性描述近期事件模型有知識截止日期截止日期后的事件模型不具備。降低幻覺的產品設計方向有三個。 要求模型在回復中標注信息來源。通過檢索系統提供原始文檔作為上下文讓模型基于文檔回答而非依賴訓練數據。在輸出后增加事實驗證步驟。 幻覺 · 產品兜底幻覺無法完全消除。你的工作是識別高風險場景并在產品設計中建立兜底機制而不是假設模型輸出都是正確的。沒有兜底機制的AI產品在C端規模化運營后必然出現嚴重的用戶信任危機。9、Temperature同一個Prompt調了三次三次結果完全不一樣下游系統解析全報錯。問題不在Prompt在Temperature設高了。Temperature 是控制模型生成隨機性的參數通常取值范圍在0到1之間部分模型支持到2。設為0或接近0時模型在生成時傾向于選擇概率最高的Token輸出結果高度穩定多次調用相同輸入通常得到相同或相近的輸出。設為較高值0.7到1.0以上時模型在生成時給低概率的Token分配更高采樣權重輸出結果更多樣多次調用相同輸入會得到不同結果。需要精確、一致輸出的場景數據抽取、格式化輸出、代碼生成選擇 低Temperature0到0.2。需要創意多樣性的場景文案生成、內容創作、頭腦風暴選擇中到高Temperature0.7到1.0。Temperature設置錯誤是很多產品早期體驗問題的直接原因。低Temperature的創意產品會顯得刻板重復高Temperature的數據提取產品會輸出不穩定的字段值。上線前先根據業務場景確定Temperature值寫進配置文檔。10、System Prompt想讓模型只回答產品相關的問題不聊別的。System Prompt是最直接的控制手段不需要改代碼就能改變模型行為。System Prompt 是在用戶輸入之前發送給模型的隱藏指令用于定義模型的角色、行為規范和輸出格式。System Prompt可以定義的內容包括輸出語言強制用中文回復、回復格式必須用JSON格式輸出、角色身份、行為邊界不回答產品功能范圍以外的問題、輸出長度限制回復控制在200字以內。三個工程約束你必須了解。System Prompt計入輸入Token每次調用都會重復計費這部分TokenSystem Prompt越長每次API成本越高。用戶輸入可以嘗試覆蓋System Prompt中的指令Prompt注入攻擊產品需要設計防御機制尤其是面向公眾開放的場景。模型對System Prompt的遵循不是100%部分情況下模型仍會偏離指令產品需要有后處理校驗邏輯不能假設模型一定按System Prompt輸出。 System Prompt · 上線前驗證寫完System Prompt后拿10條真實用戶輸入跑一遍驗證模型是不是真的按要求輸出。不跑測試直接上線后面出的問題全是低級錯誤。11、Chain-of-Thought多步驟的數學題直接問模型模型傾向于壓縮中間步驟直接跳到答案錯誤率偏高。Chain-of-ThoughtCoT 的做法是在Prompt里加一句請一步步思考或先列出推理步驟再給出結論引導模型顯式輸出每一步推導過程。中間步驟寫出來之后最終答案的準確率通常有顯著提升。效果在推理密度高的任務上最明顯比如數學計算、邏輯推斷、代碼調試、多條件判斷。簡單的分類或提取任務不需要CoT加了只是增加輸出Token數量和延遲。推理模型概念5可以理解為內置了CoT機制模型自動執行思維鏈推理不需要Prompt中手動引導。如果產品已用推理模型再加一步步思考只是浪費Token。12、Few-Shot描述了半天輸出格式模型就是不按要求來。與其寫更長的格式說明不如直接給兩三個例子。Few-Shot 是在Prompt中提供幾個輸入-輸出示例引導模型按照示例格式和邏輯處理新的輸入。在System Prompt或用戶消息中提供2到5組示例隨后提供需要處理的新輸入。模型通過模式匹配按照示例的格式產出結果。Few-Shot在三類場景效果明顯。 需要特定輸出格式但格式描述復雜時用示例代替冗長的格式說明。需要模型遵循特定分類標準時比如將用戶反饋按內部標準分類示例比文字描述更精確。需要保持輸出風格一致時提供風格樣本。Few-Shot會消耗額外的輸入Token。示例內容越長、示例數量越多Token消耗越高。高頻調用場景下需要在效果和成本之間找平衡點通常2到3個示例是性價比最高的數量。13、Zero-Shot拿到一個新任務第一反應是要不要先寫幾個示例。大多數情況下不需要。Zero-Shot 是不提供任何示例直接描述任務要求讓模型完成任務的方式。當前主流大模型GPT-4系列、Claude 3系列、Gemini 1.5系列在Zero-Shot條件下的指令理解能力已相當強大量常規任務摘要、翻譯、分類、提取不需要示例就能完成。設計Prompt時先用Zero-Shot試效果如果輸出格式或質量不滿足要求再引入Few-Shot。不要默認加入大量示例因為示例會增加Token消耗和推理延遲。Zero-Shot效果差的時候優先檢查任務描述是否足夠精確而不是立即堆砌示例。模糊的任務描述在Zero-Shot條件下會導致模型理解偏差這時候問題在描述不在方法。14、Pre-training模型對最近兩個月發生的事情一無所知問了就編這是預訓練數據有截止日期導致的。Pre-training預訓練 是大模型建立基礎能力的階段也是成本最高的階段。預訓練的過程是在數以萬億計的文本數據上網頁、書籍、論文、代碼等通過預測下一個Token的任務持續訓練模型權重。模型在這個過程中未直接學習任何特定任務但獲得了語言規律、事實知識、推理能力和世界常識的隱式表達。預訓練對你有兩個直接影響。預訓練數據有時間范圍通常滯后當前時間6到18個月。2024年Q4發布的模型訓練數據截止時間可能是2024年Q1到Q2。截止日期之后的事件和知識模型不具備這是幻覺的高發場景之一。產品中涉及時效性信息的功能需要通過檢索系統補充最新數據不能依賴模型的內置知識。不同廠商在預訓練數據規模、質量和訓練策略上的差異決定了模型的基礎能力水平。這是不同模型在Benchmark上表現差異的根本原因不是單純的參數量差異。產品功能涉及時效性信息時默認加檢索系統補充最新數據不要指望模型自帶的知識能覆蓋你的業務場景。15、SFT通用對話模型在垂直領域總是輸出不精確的術語或者格式不符合內部規范。這時候可以考慮用領域數據做一次SFT。SFTSupervised Fine-Tuning監督微調 是在預訓練模型基礎上用人工標注的指令-回復數據對進行有監督訓練理解RLHF的實際價值在于它解釋了為什么不同廠商的模型在 安全限制和回復風格 上存在明顯差異。這是不同的標注標準和偏好設計的結果不是模型能力差異造成的。選型時如果發現某個模型太保守或太激進根源在RLHF階段的標注偏好設定。17、Quantization部署一個大參數模型需要的GPU顯存動輒幾百GB硬件預算直接爆掉。Quantization是把硬件成本砍下來的核心手段。Quantization量化 是通過降低模型權重的數值精度來減少模型存儲空間和推理計算量的技術。模型權重默認以16位浮點數FP16存儲。量化將精度降低到8位整數INT8甚至4位整數INT4存儲空間和計算量隨之減少。對你的直接影響體現在三個方面。成本方面INT4量化后的模型相比FP16版本推理使用的GPU顯存減少約75%在相同硬件上可以部署更大參數量的模型或者處理更多并發請求。質量方面量化會引入精度損失。INT4量化的模型在某些任務上的準確率低于FP16版本具體損失因任務類型和量化算法而異。速度方面量化后的推理速度通常更快延遲降低對實時交互類產品有價值。老王建議選型時先跑一輪業務場景測試確認精度損失在可接受范圍內再決定用哪個量化級別。不能默認量化版本與原版質量相同。18、Parameter Count對比兩個模型一個7B一個70B直覺告訴你70B更強。大多數情況下是對的但不絕對。Parameter Count參數量 是模型中可訓練權重的總數量通常以十億BillionB為單位如7B、70B、405B。有三個反直覺的認知。更大不等于更好。 在同等訓練質量下更大的參數量通常意味著更強的能力但訓練數據質量、微調策略、架構設計同樣決定模型能力。一個經過高質量數據精煉訓練的7B模型在特定任務上可以超過粗糙訓練的70B模型。參數量決定部署成本。 70B參數的模型在FP16精度下需要約140GB顯存需要2張A100。405B參數模型需要約810GB顯存硬件成本顯著提升。評估私有化部署方案時必須將參數量與GPU成本對應。參數量與API定價正相關。 主流大模型API定價按模型版本分層更大參數量的版本每百萬Token的費用更高。早期規劃階段就把參數量和API定價的關系納入成本模型選型時先從小模型試起能滿足業務需求就不上大模型。19、Benchmark廠商宣傳MMLU得分92.3%超越GPT-4看起來很強。但Benchmark得分高不等于你的業務場景好用。Benchmark基準評測 是用于衡量大模型能力的標準化測試集選型時需要參考但不能只看這個。MMLU覆蓋57個學科的知識問答包括數學、歷史、法律、醫學等評估模型的知識廣度和理解能力。MATH是高中到競賽級別的數學題評估模型的數學推理能力。準確率低于60%的模型在數學密集型任務中不適合作為主力模型。HumanEval是編程任務評測評估代碼生成的功能正確率。MMLU-Pro和SimpleQA分別針對專業場景知識和事實準確性。老王的經驗是最可靠的選型方法是用你的實際業務數據構造測試集在候選模型上實測以業務任務的準確率作為選型依據。廠商Benchmark可能存在測試集污染只看官方榜單排名會踩坑。20、Emergent Ability小模型跑不動的多步驟推理任務換了個大一號的模型同樣的任務突然就能做了。這不是玄學是涌現。Emergent Ability涌現能力 是指大模型在參數量或訓練數據規模達到某個閾值后突然具備之前沒有的能力且該能力無法從更小規模的模型線性外推。這個概念解釋了為什么模型升級有時體驗到能力的質變而不是量變。多步驟數學推理在部分模型規模閾值以下準確率接近隨機超過閾值后準確率迅速提升。代碼調試、復雜邏輯判斷、跨語言理解等任務均在不同規模節點上出現類似現象。對你的應用價值是當升級到更大規模的模型時可能解鎖之前無法實現的產品功能。小模型跑不動的任務換大模型試一次是有數據支撐的策略。涌現的邊界是并非所有任務都存在明確的涌現閾值也不是所有升級都能帶來涌現效果。小模型做不到的事先換大模型試一輪成了就上不成再找別的方案。如何學習大模型 AI 由于新崗位的生產效率要優于被取代崗位的生產效率所以實際上整個社會的生產效率是提升的。但是具體到個人只能說是“最先掌握AI的人將會比較晚掌握AI的人有競爭優勢”。這句話放在計算機、互聯網、移動互聯網的開局時期都是一樣的道理。我在一線科技企業深耕十二載見證過太多因技術卡位而躍遷的案例。那些率先擁抱 AI 的同事早已在效率與薪資上形成代際優勢我意識到有很多經驗和知識值得分享給大家也可以通過我們的能力和經驗解答大家在大模型的學習中的很多困惑。我們整理出這套AI 大模型突圍資料包? 從零到一的 AI 學習路徑圖? 大模型調優實戰手冊附醫療/金融等大廠真實案例? 百度/阿里專家閉門錄播課? 大模型當下最新行業報告? 真實大廠面試真題? 2026 最新崗位需求圖譜所有資料 ?? 朋友們如果有需要《AI大模型入門進階學習資源包》下方掃碼獲取~① 全套AI大模型應用開發視頻教程包含提示工程、RAG、LangChain、Agent、模型微調與部署、DeepSeek等技術點② 大模型系統化學習路線作為學習AI大模型技術的新手方向至關重要。 正確的學習路線可以為你節省時間少走彎路方向不對努力白費。這里我給大家準備了一份最科學最系統的學習成長路線圖和學習規劃帶你從零基礎入門到精通③ 大模型學習書籍文檔學習AI大模型離不開書籍文檔我精選了一系列大模型技術的書籍和學習文檔電子版它們由領域內的頂尖專家撰寫內容全面、深入、詳盡為你學習大模型提供堅實的理論基礎。④ AI大模型最新行業報告2025最新行業報告針對不同行業的現狀、趨勢、問題、機會等進行系統地調研和評估以了解哪些行業更適合引入大模型的技術和應用以及在哪些方面可以發揮大模型的優勢。⑤ 大模型項目實戰配套源碼學以致用在項目實戰中檢驗和鞏固你所學到的知識同時為你找工作就業和職業發展打下堅實的基礎。⑥ 大模型大廠面試真題面試不僅是技術的較量更需要充分的準備。在你已經掌握了大模型技術之后就需要開始準備面試我精心整理了一份大模型面試題庫涵蓋當前面試中可能遇到的各種技術問題讓你在面試中游刃有余。以上資料如何領取為什么大家都在學大模型最近科技巨頭英特爾宣布裁員2萬人傳統崗位不斷縮減但AI相關技術崗瘋狂擴招有3-5年經驗大廠薪資就能給到50K*20薪不出1年“有AI項目經驗”將成為投遞簡歷的門檻。風口之下與其像“溫水煮青蛙”一樣坐等被行業淘汰不如先人一步掌握AI大模型原理應用技術項目實操經驗“順風”翻盤這些資料真的有用嗎這份資料由我和魯為民博士(北京清華大學學士和美國加州理工學院博士)共同整理現任上海殷泊信息科技CEO其創立的MoPaaS云平臺獲Forrester全球’強勁表現者’認證服務航天科工、國家電網等1000企業以第一作者在IEEE Transactions發表論文50篇獲NASA JPL火星探測系統強化學習專利等35項中美專利。本套AI大模型課程由清華大學-加州理工雙料博士、吳文俊人工智能獎得主魯為民教授領銜研發。資料內容涵蓋了從入門到進階的各類視頻教程和實戰項目無論你是小白還是有些技術基礎的技術人員這份資料都絕對能幫助你提升薪資待遇轉行大模型崗位。以上全套大模型資料如何領取