)
面對不同的大模型排行榜真正困難的不是找到一個名次而是判斷這個名次反映的是用戶偏好、標準化測試、軟件工程能力還是價格與速度.如果只想快速了解當前大模型的綜合表現優先查看Arena和Artificial Analysis前者更接近真實用戶的使用偏好后者適合同時比較能力、價格和推理速度。專項能力則應結合 LiveBench、SWE-bench 等對應基準判斷。網站編號表示推薦閱讀順序不代表對平臺權威性的絕對排名動態榜單的結果和維護狀態仍可能繼續變化。網站匯總評測網站開發/維護團隊主要方向更新狀態ArenaArena Team起源于 UC Berkeley SkyLab / LMSYS真實用戶偏好、文本、多模態、代碼、Agent持續更新Artificial AnalysisArtificial Analysis綜合能力、價格、速度、Agent、API持續更新LiveBenchAbacus.AI、NYU、NVIDIA、UMD、USC 等研究人員動態題庫、抗污染、客觀評分代碼倉庫持續更新官網顯示“Showing LiveBench-2026-06-25 — the latest release”SWE-benchSWE-bench Team起源于 Princeton、PLI、UChicago軟件工程、Coding Agent持續更新LM Market CapAnalyxa LLC多來源綜合排名、價格、速度、上下文與趨勢持續更新官方稱模型元數據每小時刷新Hugging Face Open LLM LeaderboardHugging Face 與開源社區開放權重模型標準基準官方已停止并歸檔OpenCompass司南上海人工智能實驗室相關團隊及開源社區中文、通用能力、多模態、專項評測本文歸檔為歷史參考主榜單最近更新時間為 2026-05-13首選推薦快速了解當前大模型表現1. ? Arena看真實用戶偏好與實際對戰表現網站簡介Arena 是基于真實用戶匿名對戰與偏好投票進行模型比較的平臺。平臺最初以 Chatbot Arena 形式出現后更名為 LMArena并于 2026 年 1 月正式更名為 Arena。其公開榜單覆蓋文本、視覺、代碼、圖像、視頻、搜索和 Agent 等多種模型與任務。開發團隊簡介Arena 最初由加州大學伯克利分校UC BerkeleySkyLab 的研究人員創建項目早期屬于 UC Berkeley / LMSYS 研究體系。此后項目公司化運營由 Arena Team 持續開發和維護。主要評測方式匿名模型對戰真實用戶投票基于成對比較數據計算模型排名文本、視覺、Web 開發、圖像、視頻、搜索、Agent 等分類榜單官方鏈接及更新時間官網https://arena.ai/更新時間動態更新截至 2026-08-19Arena 官方最近公開的榜單產品更新日期為2026-08-14。排行榜https://arena.ai/leaderboard更新時間動態更新截至 2026-08-19Arena 官方最近公開的榜單產品更新日期為2026-08-14。2. ? Artificial Analysis綜合比較模型能力、價格與速度網站簡介Artificial Analysis 是獨立 AI 基準測試與分析平臺公開比較大語言模型和 AI API 服務商的能力、價格、輸出速度、延遲、上下文窗口以及其他性能指標。其模型榜單包含 Artificial Analysis Intelligence Index并提供代碼、Agent、長上下文、多模態、指令遵循等專項評測。開發團隊簡介Artificial Analysis 由同名獨立 AI 基準測試公司開發和維護。平臺業務覆蓋語言模型評測、推理性能、AI 硬件、語音、圖像與視頻生成、Agent 等方向。主要評測方式Artificial Analysis Intelligence Index獨立運行的模型能力基準測試Coding、Agentic、Long Context、Multimodal 等專項評測API 輸出速度、首 Token 延遲、端到端響應時間測試模型與 API 價格比較官方鏈接及更新時間官網https://artificialanalysis.ai/更新時間持續更新截至 2026-08-19首頁 Changelog 最近一條公開更新為2026-08-18。大模型排行榜https://artificialanalysis.ai/leaderboards/models更新時間動態更新截至 2026-08-19平臺最近一批公開語言模型評測更新日期為2026-08-18。其他評測與基準測試網站3. LiveBench強調抗污染的動態評測網站簡介LiveBench 是面向大語言模型的基準測試和排行榜目標之一是降低測試集污染對評測結果的影響。其題目來源包括數學競賽、論文、新聞和數據集等并使用具有客觀標準答案的任務進行自動評分。開發團隊簡介LiveBench 由來自 Abacus.AI、紐約大學NYU、NVIDIA、馬里蘭大學UMD和南加州大學USC等機構的研究人員共同開發項目由 Abacus.AI 贊助。其論文入選 ICLR 2025 Spotlight。主要評測方式使用較新的信息來源構造題目以限制測試集污染使用可驗證的客觀標準答案進行自動評分Reasoning、Coding、Mathematics、Data Analysis、Language、Instruction Following 等分類評測官方倉庫持續維護模型配置與評測代碼官方鏈接及更新時間官網與排行榜https://livebench.ai/更新時間動態頁面展示 Showing LiveBench-2026-06-25 — the latest release.GitHubhttps://github.com/LiveBench/LiveBench更新時間最近提交2026-08-18。4. SWE-bench軟件工程與 Coding Agent 評測網站簡介SWE-bench 是面向大語言模型和軟件工程 Agent 的代碼能力評測基準。其任務來自真實 GitHub Issue 和對應代碼倉庫要求模型理解現有代碼庫、修改代碼并通過項目測試。SWE-bench 官方榜單包括 SWE-bench、SWE-bench Verified、SWE-bench Multilingual、SWE-bench Multimodal、SWE-bench Lite 等版本并在 2026 年繼續維護相關榜單和軟件工程評測項目。開發團隊簡介SWE-bench 最初由來自 Princeton University、Princeton Language and IntelligencePLI和 University of Chicago 的研究人員提出。原始論文作者包括 Carlos E. Jimenez、John Yang、Alexander Wettig、Shunyu Yao、Kexin Pei、Ofir Press 和 Karthik Narasimhan。項目由 SWE-bench Team 持續維護。主要評測方式真實 GitHub Issue真實開源代碼倉庫自動運行測試驗證補丁正確性以成功解決任務的比例作為核心指標之一Verified、Multilingual、Multimodal 等不同任務集合官方鏈接及更新時間官網與排行榜https://www.swebench.com/更新時間動態更新官網 News 最近一項標為2026 年 5 月ProgramBench官方代碼倉庫截至核對日仍在更新。GitHubhttps://github.com/SWE-bench/SWE-bench更新時間最近提交2026-08-18。5. LM Market Cap綜合查看模型排名、價格與使用成本網站簡介LM Market Cap 是一個 AI 模型排名與比較平臺。它匯總多個公開評測來源為模型計算統一的 LMC Score并集中展示價格、輸出速度、上下文窗口、能力特性和排名變化等信息。除了大語言模型網站還收錄圖像與視頻生成模型。LM Market Cap 更適合用來快速篩選和橫向比較模型而不是作為某項原始基準測試的官方結果來源。需要核驗具體能力時仍應回到 Arena、LiveBench、SWE-bench 等原始評測平臺。開發團隊簡介LM Market Cap 官網將其標注為 Analyxa LLC 旗下產品。官網公開資料主要介紹平臺功能和排名方法未提供更詳細的開發團隊成員信息。主要評測方式匯總 Arena Elo、LiveBench、SWE-bench Verified、模型官方報告等多個來源的數據對不同基準分數進行基線扣除和歸一化統一換算到 0100 分LMC Score 由基準測試分數90%、能力特性5%和上下文窗口5%組成在基準測試部分將 Arena Elo 作為 30% 的權重其余任務基準合計占 70%單獨展示模型價格、速度、上下文窗口、可用方式和歷史排名變化支持按照質量、成本和使用需求調整權重生成自定義排名官方鏈接及更新時間官網與排行榜https://lmmarketcap.com/更新時間動態更新截至 2026-08-19官網顯示榜單處于 Live 狀態官方說明模型元數據每小時刷新。排名方法https://lmmarketcap.com/docs/methodology更新時間方法頁持續維護截至 2026-08-19頁面模型評估方法變更記錄的最新版本為v32026 年 4 月。歷史參考6. Hugging Face Open LLM Leaderboard已停止維護網站簡介Open LLM Leaderboard 是 Hugging Face 曾長期維護的開放大語言模型排行榜主要用于比較公開權重模型在多個標準基準上的表現。該榜單曾廣泛用于 Llama、Mistral、Qwen 等開放模型的橫向比較。Hugging Face 在2025-03-13正式宣布 Open LLM Leaderboard 退役。官方歸檔材料繼續保留舊版榜單、評測方法和歷史結果。開發團隊簡介該榜單由 Hugging Face 團隊及開源社區建設和維護依托 Hugging Face Hub、Datasets 和評測工具運行開放模型基準測試。主要評測方式歷史版本使用過 IFEval、BBH、MATH、GPQA、MMLU-Pro 等標準基準評測開放模型。官方鏈接及更新時間歸檔文檔https://huggingface.co/docs/leaderboards/en/open_llm_leaderboard/archive更新時間歸檔頁面本身未公開單一最后更新時間其中 Open LLM Leaderboard v1 官方記錄為2024 年 6 月歸檔。官方退役公告https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard/discussions/1135更新時間2025-03-13官方宣布 leaderboard officially retiring。7. OpenCompass司南本文作為歷史參考網站簡介OpenCompass 是面向大語言模型和多模態大模型的開源評測平臺提供模型評測框架、數據集、評測配置和公開榜單。其評測體系支持客觀評測和主觀評測并覆蓋知識、語言、理解、推理、代碼、安全及垂直領域等能力。本文將 OpenCompass 的綜合大模型排行榜列入“歸檔/歷史參考”。截至 2026-08-19主榜單頁面顯示的最近一次更新時間為2026-05-13CompassArena 頁面顯示的榜單更新日期為2026-06-11。OpenCompass 代碼倉庫仍在維護但官網主頁顯示的模型已經較為陳舊因此顯示歸檔。開發團隊簡介OpenCompass 由上海人工智能實驗室相關團隊開發并維護同時接受開源社區貢獻。其開源代碼、文檔和多個專項評測平臺仍可訪問。主要評測方式標準數據集客觀評測LLM-as-a-Judge 評測主觀模型比較CompassAcademic 學術榜單CompassArena 匿名模型對戰與用戶投票多模態、醫療、金融等專項評測官方鏈接及更新時間OpenCompass 官網https://opencompass.org.cn/更新時間官網首頁未公開單一最后更新時間本文參考的綜合主榜單最近一次頁面更新時間為2026-05-13。大語言模型主榜單https://rank.opencompass.org.cn/leaderboard-llm-v2更新時間2026-05-13主榜單頁面顯示的最近更新時間。