
1. 項目概述從零解析抖音用戶視頻列表獲取最近在做一個內容分析的小工具需要批量獲取某個特定抖音創作者的所有視頻信息比如標題、發布時間、點贊數、評論數這些基礎數據。一開始覺得這應該是個挺簡單的活兒不就是調個接口嘛。但真上手才發現抖音這套防護機制做得相當嚴密從網頁端到App端各種反爬策略層層疊疊直接請求官方接口幾乎寸步難行。網上能找到的很多所謂“教程”要么已經失效要么語焉不詳踩了不少坑。今天就把我折騰了挺久才跑通的一套相對穩定、可復現的方案整理出來核心思路是通過模擬App請求獲取用戶唯一的sec_uid然后調用其作品列表接口。整個過程會涉及到請求庫的使用、參數逆向、簽名機制以及如何優雅地處理風控。無論你是想做數據分析、內容監控還是其他自動化工具這套方法都能給你提供一個扎實的起點。2. 核心思路與技術選型2.1 為什么不能直接爬取網頁首先得明確一點直接爬取抖音網頁版www.douyin.com來獲取用戶視頻列表在2023年之后已經變得非常困難。抖音在前端做了大量的混淆和加密關鍵數據如用戶作品列表通常通過異步接口加載這些接口的URL參數尤其是簽名X-Bogus和_signature生成邏輯極其復雜且頻繁變動。試圖在瀏覽器中逆向JavaScript來復現這套邏輯對于大多數開發者來說成本太高且維護性極差。2.2 移動端API的優勢與挑戰相比之下抖音App的API接口雖然也有簽名和風控但其協議相對穩定參數邏輯也更有跡可循。我們的核心目標接口是獲取用戶作品列表的API其形態通常類似于https://www.iesdouyin.com/web/api/v2/aweme/post/這個接口需要幾個關鍵參數sec_uid: 用戶的唯一標識這是整個流程的起點和關鍵。count: 每次請求期望返回的視頻數量通常最大為20。max_cursor: 分頁游標用于獲取下一頁數據首次請求為0。最大的挑戰在于這個接口以及獲取sec_uid的接口都會校驗請求頭Headers和簽名。簽名錯誤或請求頭不完整會直接返回403或400錯誤。因此我們的技術方案核心就變成了如何偽裝成一個合法的抖音App客戶端去發送請求。2.3 技術棧與工具選擇基于以上分析我選擇了以下技術棧這也是目前爬蟲領域處理這類問題的常見組合Python Requests: 作為主要的HTTP請求庫requests足夠簡單和強大。需要配合session來維持Cookie和部分Header。抓包工具: 這是逆向分析的“眼睛”。我主要使用Charles / Fiddler: 用于在電腦上抓取模擬器或真機代理過來的流量適合靜態分析API調用鏈。Packet Capture / HttpCanary (安卓): 手機端直接抓包無需Root即可抓取抖音App的HTTPS流量需安裝證書對于動態觀察請求生成過程非常方便。逆向分析工具: 主要靠瀏覽器開發者工具F12和抓包工具分析請求/響應內容、參數構成。并不需要深入到Native層的SO庫逆向。關鍵思路我們并不需要完全逆向抖音的整個加密算法如X-Bogus因為對于獲取公開視頻列表這個需求我們可以通過復用從真實App中捕獲的、有效的請求參數和Headers來達到目的。重點是理解哪些參數是固定的哪些是每次需要變化的以及如何構造一個“像模像樣”的請求。注意任何自動化訪問行為都應遵守網站的robots.txt協議并嚴格控制請求頻率避免對目標服務器造成壓力。本方案僅用于技術學習和個人合法的數據收集嚴禁用于商業爬取、騷擾或其他違反抖音用戶協議的行為。3. 實操第一步定位并獲取關鍵參數 sec_uidsec_uid是抖音用戶體系中的一個核心加密ID不同于我們在分享鏈接中看到的短ID或數字ID它更長、更唯一是調用大多數用戶相關API的必需參數。獲取不到它后續所有工作都無法開展。3.1 尋找 sec_uid 的來源有多個入口可以獲取sec_uid這里介紹最穩定和直接的兩種方法。方法一從用戶分享鏈接或主頁地址提取推薦這是最便捷的方式。讓目標用戶在抖音App內點擊“分享主頁”復制鏈接。鏈接格式通常如下https://v.douyin.com/ABC123Def/或https://www.douyin.com/user/MS4wLjABAAAAxxxxx你需要訪問這個短鏈接它會經過一次或多次跳轉最終到達用戶的長鏈接主頁。我們的目標是在跳轉后的最終主頁URL中或者頁面源代碼里找到sec_uid。操作步驟在瀏覽器建議無痕模式避免緩存干擾中打開分享的短鏈接。等待頁面完全加載即跳轉停止觀察地址欄。最終的URL可能形如https://www.douyin.com/user/MS4wLjABAAAAvWZf-xxxx-xxxx?modal_id...注意這里的MS4wLjABAAAAvWZf-xxxx-xxxx并不是sec_uid它是另一種用戶標識。按下F12打開開發者工具切換到Network網絡選項卡刷新頁面。在網絡請求中尋找一個名稱包含/user/profile/或/aweme/v1/web/user/profile/的請求。點擊這個請求在Response響應標簽頁中你會看到一段JSON數據。在這段JSON中搜索sec_uid字段。它的值是一長串由字母、數字、下劃線和減號組成的字符串例如MS4wLjABAAAAvWZfxxxxxxxxxxxxxxxxxxxxxxxxxx。復制這個值這就是我們需要的sec_uid。方法二通過抓包App直接獲取API響應如果你在手機上進行抓包例如使用HttpCanary過程更直觀打開抓包App開始錄制。打開抖音App進入目標用戶的主頁。停止抓包在抓包記錄中搜索關鍵詞sec_uid。你通常會找到一個請求URL為https://*.douyin.com/aweme/v1/web/user/profile/other/的請求其響應體JSON中就包含了sec_uid。3.2 編寫代碼提取 sec_uid手動找一次可以但自動化工具需要能自動完成這個過程。思路是訪問短鏈接允許重定向從最終響應的HTML內容或重定向地址中解析出sec_uid。但經過測試直接從HTML中解析sec_uid的難度在增大抖音將其隱藏得更深。一個更可靠的方法是模擬一次訪問主頁的請求并從其后續發出的API請求中攔截。但這對自動化腳本要求較高。因此在實際項目中我往往采用一個折中方案將sec_uid作為工具的輸入參數。即用戶需要手動通過上述方法一獲取一次sec_uid然后提供給程序。雖然多了一步手動操作但極大地提高了程序的穩定性和復雜度。如果非要實現全自動可以嘗試在請求主頁后用正則表達式在頁面HTML或內聯的JavaScript變量中搜索sec_uid但匹配規則需要經常更新不穩定。import re import requests def extract_sec_uid_from_share_url(share_url): 嘗試從分享鏈接中提取sec_uid此方法穩定性有限僅供參考 headers { User-Agent: Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/91.0.4472.124 Safari/537.36 } session requests.Session() session.headers.update(headers) # 允許重定向獲取最終的響應 try: response session.get(share_url, allow_redirectsTrue, timeout10) final_url response.url html_content response.text # 方法1: 嘗試從最終URL的路徑中匹配適用于某些格式 # 例如https://www.douyin.com/user/MS4wLjABAAAAvWZf... # 注意這個MS4wLjAB... 是sec_uid的一種表現形式但通常需要直接使用 pattern_from_url r/user/(MS4wLjAB[^/?]) match re.search(pattern_from_url, final_url) if match: # 實際上從URL路徑中獲取的這個就是sec_uid return match.group(1) # 方法2: 嘗試從HTML的script標簽或JSON數據中匹配復雜且易變 # 這里是一個簡化的、可能很快失效的正則示例 pattern_in_html rsec_uid\s*:\s*([^]) match re.search(pattern_in_html, html_content) if match: return match.group(1) except Exception as e: print(f提取sec_uid失敗: {e}) return None # 使用示例 share_link https://v.douyin.com/ABC123Def/ sec_uid extract_sec_uid_from_share_url(share_link) if sec_uid: print(f提取到的 sec_uid: {sec_uid}) else: print(自動提取失敗請手動獲取。)實操心得在實際生產環境中我強烈建議將sec_uid的獲取作為獨立的手動前置步驟。你可以寫一個簡單的使用說明告訴用戶如何通過瀏覽器開發者工具獲取。這比維護一個脆弱不堪的全自動提取函數要省心得多也穩定得多。把精力集中在核心的列表獲取邏輯上。4. 構建仿真的App請求環境拿到sec_uid后下一步就是模擬App去調用作品列表接口。直接用一個裸的requests.get()肯定會吃閉門羹。我們需要精心構造請求頭Headers和查詢參數Query Parameters。4.1 分析并準備關鍵請求頭通過抓包抖音App的請求你會發現其Headers包含了許多特征字段。以下是一些最關鍵且通常需要攜帶的Headersimport requests # 一個模擬抖音App請求的Headers示例部分值需要替換 headers { # 用戶代理模擬抖音App User-Agent: com.ss.android.ugc.aweme/2020102100 (Linux; U; Android 11; zh_CN; MI 9; Build/RKQ1.200826.002; Cronet/TTNetVersion:3c28619c 2020-05-19), # 宿主App Host: www.iesdouyin.com, # 連接方式 Connection: keep-alive, # 接受編碼 Accept-Encoding: gzip, deflate, br, # 接受語言 Accept-Language: zh-CN,zh;q0.9,en-US;q0.8,en;q0.7, # 這個Cookie至關重要通常包含了登錄態和設備標識 Cookie: 你的Cookie字符串從抓包中獲取, # 引用來源有時可留空有時需要是抖音域內地址 Referer: https://www.douyin.com/, # 接受的內容類型 Accept: application/json, text/plain, */*, # 內容類型 Content-Type: application/x-www-form-urlencoded, }關鍵點解析User-Agent: 這是設備的“指紋”。上述示例是一個Android抖音客戶端的UA。保持一個真實有效的UA很重要。你可以從抓包數據中直接復制也可以在網上搜索最新的抖音UA。Cookie:這是身份認證和風控的核心Cookie里通常包含了sessionid、install_id、ttwid、odin_tt等關鍵字段。這些字段標識了你的設備和模擬的登錄狀態。沒有有效的Cookie接口會返回403或要求登錄。如何獲取通過抓包工具在任意一個成功的抖音API請求的Headers里找到Cookie字段完整復制下來。這個Cookie有一定有效期。其他Headers: 如Host,Referer,Accept-*等盡量與抓包到的請求保持一致填滿總比空缺好。4.2 理解并處理簽名參數抖音的API特別是涉及數據獲取的幾乎都帶有簽名參數最常見的是X-Bogus和_signature。這些參數由客戶端根據請求URL、請求體、時間戳、設備信息等計算生成用于防止請求被偽造。對于我們這個“獲取公開視頻列表”的接口好消息是經過測試在一定條件下這個接口可能對簽名校驗不那么嚴格或者我們可以通過復用一套有效的參數來繞過。在抓包時你會看到類似這樣的請求URLhttps://www.iesdouyin.com/web/api/v2/aweme/post/?sec_uidMS4wLjABAAAA...count20max_cursor0aid1128_signaturexxxxxx這里的_signature就是簽名。我們的策略是直接復用從抓包到的成功請求中復制整個URL包括上面的_signature。然后我們只修改max_cursor和count參數來翻頁而sec_uid和_signature保持不變。注意_signature很可能與sec_uid、max_cursor等參數綁定只修改max_cursor可能失效。需要測試。尋找無需簽名的接口抖音有一些內部或舊的接口版本可能簽名校驗不嚴。這需要持續抓包和測試。終極方案如果上述方法失效則意味著必須逆向簽名算法。這涉及到更復雜的JavaScript或Native代碼逆向超出了本文的范疇。通常需要分析X-Bogus的生成邏輯網上有部分開源項目如douyin-signature嘗試解決但需要自行維護更新。踩坑記錄我最初嘗試完全自己構造參數總是返回403。后來發現直接使用抓包獲得的完整請求URL包含當時生成的_signature去請求竟然可以成功。這說明對于這個列表接口簽名可能有一定的“會話”或“短期”有效性或者服務器端對來自同一設備標識Cookie的請求做了寬松處理。所以優先嘗試“復制粘貼”大法。5. 實現視頻列表的獲取與分頁假設我們已經通過“復用”策略獲得了一個可以工作的請求模板。接下來就是編寫代碼循環請求直到獲取所有視頻。5.1 發起單次請求并解析數據我們首先實現獲取第一頁max_cursor0數據的函數。import requests import json import time def get_aweme_list_by_page(sec_uid, max_cursor0, count20): 獲取用戶指定頁的視頻列表 :param sec_uid: 用戶sec_uid :param max_cursor: 分頁游標第一頁為0 :param count: 每頁數量最大似乎為20 :return: 返回本次請求的JSON數據以及下一次的max_cursor # 這是從抓包中復制的完整URL模板包含了當時有效的_signature。 # !!! 注意你需要替換成自己抓包得到的、有效的URL !!! # 重點URL中的_signature參數是綁定的直接復用。我們只替換sec_uid, max_cursor, count。 url_template https://www.iesdouyin.com/web/api/v2/aweme/post/?sec_uid{}count{}max_cursor{}aid1128_signature你的_signature值 url url_template.format(sec_uid, count, max_cursor) headers { User-Agent: 你的抖音App User-Agent, Cookie: 你的有效Cookie, Accept: application/json, text/plain, */*, Host: www.iesdouyin.com, Connection: keep-alive, # ... 其他必要的headers } try: response requests.get(url, headersheaders, timeout10) response.raise_for_status() # 檢查HTTP錯誤 data response.json() # 檢查接口返回狀態 if data.get(status_code) 0: aweme_list data.get(aweme_list, []) has_more data.get(has_more, 0) 1 next_max_cursor data.get(max_cursor, 0) return aweme_list, next_max_cursor, has_more else: print(f接口返回錯誤: {data}) return [], max_cursor, False except requests.exceptions.RequestException as e: print(f網絡請求失敗: {e}) return [], max_cursor, False except json.JSONDecodeError as e: print(fJSON解析失敗: {e}, 響應內容: {response.text[:200]}) return [], max_cursor, False # 使用示例 sec_uid MS4wLjABAAAAvWZfxxxxxxxxxxxxxxxxxxxxxxxxxx videos, next_cursor, has_more get_aweme_list_by_page(sec_uid, max_cursor0, count20) if videos: print(f本頁獲取到 {len(videos)} 個視頻) for video in videos: aweme_id video.get(aweme_id) desc video.get(desc) # 視頻標題/描述 create_time video.get(create_time) statistics video.get(statistics, {}) digg_count statistics.get(digg_count, 0) # 點贊 comment_count statistics.get(comment_count, 0) # 評論 share_count statistics.get(share_count, 0) # 分享 print(f 視頻ID: {aweme_id}, 描述: {desc[:30]}..., 點贊: {digg_count}) else: print(未獲取到視頻數據)5.2 實現自動分頁抓取單次請求最多返回20條要獲取全部視頻需要根據has_more和max_cursor進行循環。def get_all_aweme_list(sec_uid, max_count100): 獲取用戶所有視頻列表直到沒有更多或達到限制 :param sec_uid: 用戶sec_uid :param max_count: 最大獲取視頻數防止無限循環 :return: 視頻列表 all_videos [] max_cursor 0 has_more True request_count 0 while has_more and len(all_videos) max_count: print(f正在請求第 {request_count 1} 頁游標: {max_cursor}) videos, next_max_cursor, has_more get_aweme_list_by_page(sec_uid, max_cursor, count20) if videos: all_videos.extend(videos) print(f 本頁獲取 {len(videos)} 個累計 {len(all_videos)} 個) else: # 如果本次沒拿到數據可能出錯了謹慎考慮是否跳出循環 print( 本次請求未獲取到數據可能已觸達末尾或遇到風控。) # 可以選擇 break 或重試邏輯 break max_cursor next_max_cursor request_count 1 # !!! 非常重要添加延遲避免請求過快觸發風控 !!! time.sleep(2 random.random()) # 隨機延遲2-3秒 print(f抓取結束。總共獲取 {len(all_videos)} 個視頻。) return all_videos # 使用示例 import random all_videos get_all_aweme_list(sec_uid, max_count200)5.3 解析與存儲視頻信息獲取到的aweme_list中的每個視頻對象結構非常豐富。除了上面示例中的基礎信息還包括視頻播放地址、封面圖、音樂信息、作者信息、地理位置等。我們可以選擇需要的字段進行提取和存儲。import csv import os from datetime import datetime def save_videos_to_csv(video_list, filenamedouyin_videos.csv): 將視頻列表保存到CSV文件 if not video_list: print(視頻列表為空無需保存。) return # 定義要保存的字段 fieldnames [ aweme_id, desc, create_time, datetime, digg_count, comment_count, share_count, collect_count, video_url, cover_url, music_title, music_author, author_uid, author_nickname ] rows [] for video in video_list: # 處理可能不存在的字段 stats video.get(statistics, {}) author video.get(author, {}) music video.get(music, {}) video_info video.get(video, {}) # 轉換時間戳 create_ts video.get(create_time, 0) if create_ts: dt_str datetime.fromtimestamp(create_ts).strftime(%Y-%m-%d %H:%M:%S) else: dt_str row { aweme_id: video.get(aweme_id, ), desc: video.get(desc, ).replace(\n, ).replace(,, ), # 處理換行和逗號 create_time: create_ts, datetime: dt_str, digg_count: stats.get(digg_count, 0), comment_count: stats.get(comment_count, 0), share_count: stats.get(share_count, 0), collect_count: stats.get(collect_count, 0), video_url: video_info.get(play_addr, {}).get(url_list, [])[0] if video_info else , cover_url: video_info.get(cover, {}).get(url_list, [])[0] if video_info else , music_title: music.get(title, ), music_author: music.get(author, ), author_uid: author.get(uid, ), author_nickname: author.get(nickname, ), } rows.append(row) # 寫入CSV with open(filename, w, newline, encodingutf-8-sig) as f: # utf-8-sig支持Excel直接打開顯示中文 writer csv.DictWriter(f, fieldnamesfieldnames) writer.writeheader() writer.writerows(rows) print(f數據已保存至 {filename}共 {len(rows)} 條記錄。) # 使用示例 save_videos_to_csv(all_videos, fdouyin_videos_{sec_uid[:10]}.csv)6. 風控應對與穩定性優化直接運行上面的代碼很可能在抓取幾十個視頻后就會收到429 Too Many Requests或者403 Forbidden的響應。這是抖音反爬機制在起作用。我們必須讓我們的爬蟲行為更“像人”。6.1 請求頻率控制這是最基本也是最重要的措施。固定延遲在每次請求之間加入sleep如time.sleep(3)。隨機延遲更好的方法是使用隨機延遲模擬人的不規則操作。例如time.sleep(2 random.random() * 3)延遲在2到5秒之間。分批次抓取如果需要抓取大量用戶不要一個接一個不停??梢宰ト∫粋€用戶后休息更長時間如5-10分鐘。6.2 請求頭與Cookie的維護Cookie失效從抓包獲取的Cookie會過期。過期后需要重新抓包更新??梢跃帉懸粋€簡單的檢測邏輯如果連續多次請求返回403或要求登錄的JSON則提示用戶更新Cookie。User-Agent池準備多個不同的、有效的抖音App User-Agent輪流使用降低單一標識被識別的風險。使用Session使用requests.Session()可以自動管理Cookie保持會話狀態比單次請求更接近真實App行為。6.3 代理IP的使用如果請求頻率過高可能會被限制IP。對于大規模抓取使用代理IP池是必要的。高質量代理選擇可靠的HTTP/HTTPS代理服務。集成到代碼中import requests proxies { http: http://your-proxy-ip:port, https: http://your-proxy-ip:port, # 注意很多代理服務器http和https都用http協議 } # 在請求時加入proxies參數 response session.get(url, headersheaders, proxiesproxies, timeout10)6.4 錯誤重試與降級策略網絡請求總可能失敗需要健壯的錯誤處理。重試機制對于網絡超時、連接錯誤等臨時性問題可以設置重試??梢允褂胻enacity庫或自己實現簡單的重試循環。import requests from tenacity import retry, stop_after_attempt, wait_fixed retry(stopstop_after_attempt(3), waitwait_fixed(2)) def safe_request(url, headers): response requests.get(url, headersheaders, timeout15) response.raise_for_status() return response識別風控響應如果返回429說明請求過快應該大幅延長等待時間如等待1分鐘后再試。如果返回403且內容提示簽名錯誤或需要登錄則可能Cookie失效或簽名策略已更新需要人工介入。保存進度在抓取大量數據時務必定期將已獲取的數據保存到文件或數據庫。即使程序中途因錯誤停止下次也可以從斷點max_cursor繼續避免前功盡棄。7. 常見問題與排查技巧實錄在實際操作中你肯定會遇到各種各樣的問題。下面是我踩過的一些坑和解決辦法。7.1 問題返回403 Forbidden或{status_code: 2146, status_msg: 請求異常請稍后重試}可能原因1Cookie失效或無效。排查檢查請求頭中的Cookie值是否完整、最新。最直接的方法是用這個Cookie在瀏覽器中訪問抖音網頁版看是否處于登錄狀態。解決重新通過抓包獲取有效的Cookie??赡茉?簽名參數_signature無效或已過期。排查你復用的URL中的_signature可能是一次性的或者與sec_uid、max_cursor強綁定。嘗試只修改max_cursor后是否失效。解決重新抓包一次列表請求獲取全新的URL和_signature。如果頻繁失效說明此接口簽名校驗嚴格需要考慮逆向簽名算法或尋找其他替代接口??赡茉?請求頭不完整或格式不對。排查對比你的請求頭和抓包中的請求頭確保關鍵字段如User-Agent,Host,Accept等一致。特別注意Cookie的格式是分號分隔的鍵值對。解決盡量復制抓包中看到的所有Headers不要遺漏。7.2 問題返回429 Too Many Requests可能原因請求頻率過高觸發了服務器的速率限制。解決立即停止當前循環等待一段時間比如5-10分鐘再繼續。增加請求間隔。將time.sleep的時間加長并加入更大的隨機因子例如time.sleep(5 random.random() * 10)。考慮使用代理IP分散請求來源。7.3 問題能獲取到數據但只有前幾頁has_more始終為 1但max_cursor不變化或循環可能原因max_cursor的處理邏輯有誤或者接口在無更多數據時仍然返回has_more1。排查打印出每次請求返回的max_cursor和has_more。如果max_cursor不再變化但has_more還是1可能意味著已經到達末尾但接口設計如此。解決在循環中增加一個判斷如果連續2-3次請求返回的max_cursor相同且獲取到的視頻列表為空或重復則判定為已抓取完畢主動跳出循環。7.4 問題如何獲取更早的歷史視頻抖音的/aweme/post/接口通常只返回最近發布的視頻具體數量可能有限比如最近1000條。要獲取更早的、被“折疊”的視頻通常需要登錄賬號后在App中觸發“查看更多”操作并抓取那個過程中調用的另一個API。這個接口的權限和風控等級更高實現起來復雜得多。對于絕大多數分析需求最近幾百條視頻已經足夠。7.5 問題視頻數據中的播放地址無法直接下載或提示“視頻不見了”視頻的play_addr播放地址返回的URL通常帶有鑒權參數有效期很短且可能檢查Referer等Header。直接用在瀏覽器中可能過一段時間就失效。解決如果需要下載視頻應該使用返回的video_id或aweme_id結合其他專門的無水印下載接口這又是另一個話題通常也需要簽名。切勿在程序中高頻訪問視頻播放地址這極易導致IP被封。最后再次強調技術是把雙刃劍。這套方法能幫你高效地收集公開數據但務必尊重平臺規則和用戶隱私將數據用于合法、合規的用途。保持較低的請求頻率避免對抖音服務器造成不必要的負擔。在實際開發中最耗時的部分往往不是寫代碼而是與平臺風控機制的“博弈”和參數的維護更新。保持耐心多測試多觀察抓包數據的變化是成功的關鍵。