
簡介電商比價系統是Web數據工程的經典實踐場景其本質是構建一條從HTTP請求、HTML解析、數據清洗、關系型存儲到API服務的完整數據鏈路。核心原理在于精準模擬瀏覽器行為繞過基礎反爬如User-Agent、Referer、Cookie組合校驗結合正則與BeautifulSoup實現高容錯HTML解析并通過MySQLDjango ORM完成強類型結構化存儲——尤其需規避浮點精度陷阱堅持使用DecimalField存價格、BigIntegerField存銷量。該方案技術價值突出體現在可調試、可驗證、可交付廣泛適用于課程設計、畢業設計及新人全棧練手。本文聚焦京東真實商品頁詳解requests輕量采集、JSON嵌套數據提取、Django Admin快速驗數等硬核落地細節。1. 項目概述一個能真正跑起來的京東比價系統長什么樣我帶過十幾屆畢業設計每年都有學生選“電商比價系統”但八成最后交的是個空殼——前端頁面能點后端API返回404數據庫里連一張表都沒建好。這次我們不畫餅直接拆解一個真實可運行、數據可驗證、部署可上線的京東商品比價系統。它不是Demo而是用PythonDjango搭起的完整閉環從requests抓取京東商品頁的真實HTML解析出價格、銷量、評論數、店鋪名等核心字段存進MySQL或PostgreSQL再通過Django Admin管理數據用Django REST Framework暴露API前端哪怕只是用curl或Postman就能調用比價結果。關鍵詞很直白python、Django、requests、京東爬蟲、數據庫——沒有花哨的“AI推薦”“智能預測”就聚焦在“把京東頁面上的數字準確抓下來、存進去、查出來、比出來”這四件事上。適合兩類人一是課程設計/畢設需要交源碼演示文檔的學生二是想練手真實Web項目的技術新人。它不教你怎么寫高并發但會告訴你為什么京東首頁不能直接requests.get()、為什么商品詳情頁要加Referer、為什么數據庫字段類型必須是Decimal而不是Float、為什么Django的Model字段命名要避開price和id這種保留字——全是踩坑后才懂的硬經驗。這個系統最核心的價值不是“能比價”而是幫你建立對Web數據流的完整認知鏈路HTTP請求 → HTML解析 → 數據清洗 → 數據庫存儲 → ORM映射 → API暴露 → 前端消費。每一步都卡在真實場景的細節里。比如requests發請求時京東會校驗User-Agent和Referer缺一不可解析時京東的商品價格藏在多個class里有的是有的是還有的被JS動態渲染你得判斷哪些能靜態提取、哪些必須模擬點擊存庫時銷量字段可能顯示“10萬”你得轉成整數100000否則數據庫會報錯Django里定義PriceField時如果用FloatField小數點后兩位的價格如¥99.90存進去可能變成99.89999999999999——這不是bug是IEEE 754浮點精度問題必須用DecimalField。這些細節文檔里不會寫但上線前一定會撞墻。所以這篇不是教程是我在實驗室陪學生調試三天三夜后把所有報錯日志、抓包截圖、SQL執行記錄整理出來的實戰筆記。2. 整體架構與技術選型邏輯為什么不用Scrapy而堅持requests2.1 架構分層五層結構每一層都解決一個具體問題這個系統不是“爬蟲網站”的簡單拼接而是嚴格分層的五層結構采集層requests fake-useragent只負責發HTTP請求、收HTML響應。不用Scrapy因為Scrapy太重——它自帶調度器、去重、中間件而京東比價的核心難點不在并發控制而在反爬對抗的精細化處理。requests更輕量你可以逐行控制headers、cookies、timeout方便調試。比如京東會檢測請求頭里的Accept-Encoding如果你傳gzip而服務器沒返回gzip壓縮內容它可能直接返回403又比如某些商品頁要求Referer必須是京東搜索結果頁否則返回空數據——這些微操requests一行代碼就能改Scrapy得配一堆中間件。解析層BeautifulSoup4 re json不依賴lxml編譯麻煩用bs4解析HTML配合正則提取JS變量里的JSON數據。京東的商品價格、SKU信息常藏在script標簽的window.__INITIAL_STATE__變量里這是純HTML解析器抓不到的必須用re.search(rwindow.INITIAL_STATE (.*?);, html)先撈出JSON字符串再json.loads()。bs4的優勢在于容錯性強——京東頁面結構經常變今天class是p-price明天可能改成J_pricebs4用soup.find(class_re.compile(rp-price|J_price))就能兼容而XPath寫死路徑會直接崩。存儲層MySQL 8.0 Django ORM不用SQLite并發差、無用戶權限管理也不用MongoDB結構化數據沒必要。京東商品字段高度結構化商品ID、標題、價格、銷量、評論數、店鋪名、上架時間——全是強類型MySQL的ACID和索引優化是剛需。Django ORM不是擺設它幫你自動生成CREATE TABLE語句但關鍵在于字段類型必須手動指定PriceField用DecimalField(max_digits10, decimal_places2)銷量用BigIntegerField因為“10萬”要轉成100000上架時間用DateTimeField(auto_now_addTrue)。很多人圖省事用CharField存價格結果排序時¥199排在¥99前面——字符串排序不是數值排序。業務層Django Views Forms比價邏輯不寫在爬蟲腳本里而放在Django的View中。比如“比價”不是簡單SELECT MIN(price)而是先查出同一商品ID的所有記錄再按店鋪分組取每個店鋪的最新一條用created_at DESC LIMIT 1最后對比各店鋪最低價。這個邏輯用原生SQL寫三行用Django ORM寫十行但好處是可測試、可復用、可加緩存。你可以在shell里直接調用compare_prices(1000123456)也能在API里復用還能給它加Redis緩存避免重復計算。展示層Django Admin REST API不做復雜前端用Django Admin當后臺管理界面——學生答辯時老師點開Admin就能看到爬取的商品列表、編輯字段、導出CSV同時用djangorestframework暴露/api/products/?keyword手機這樣的REST接口前端用fetch就能調比寫HTML模板快十倍。Admin不是“偷懶”而是快速驗證數據質量的最有效工具如果Admin里商品價格全是0說明解析層出錯了如果銷量字段顯示“10萬”沒轉成數字說明清洗邏輯漏了——一眼定位問題。2.2 關鍵技術選型背后的硬道理為什么用requests不用SeleniumSelenium啟動瀏覽器太慢京東商品頁平均加載要3秒爬100個商品就是5分鐘而requestssession復用1秒內搞定。更重要的是Selenium容易被京東識別為自動化工具——它的WebDriver特征太明顯即使加了undetected-chromedriverIP被封概率也高。requests只要headers仿得像成功率超90%。實測同一臺機器requests爬1000個商品失敗率約5%Selenium失敗率超30%主要卡在驗證碼和滑塊。為什么數據庫選MySQL而非PostgreSQL學生環境普遍是WindowsNavicatMySQL安裝包一鍵安裝PostgreSQL要配環境變量、改pg_hba.conf。而且Django對MySQL的兼容性更好——比如MySQL的GROUP BY默認允許select非group字段雖然不標準而PostgreSQL嚴格報錯學生調試時容易懵。性能上百萬級商品數據MySQL的MyISAM引擎做全文檢索比PostgreSQL快但這里我們用Django的SearchVectorPostgreSQL專屬反而更準所以最終方案是開發用MySQL生產部署用PostgreSQLDjango的DATABASES配置一換就行ORM層完全不用改。為什么Django不用FastAPIFastAPI確實快但它沒有Admin后臺沒有內置用戶認證沒有遷移命令makemigrations。畢設答辯時老師要看“后臺管理功能”你總不能現場寫個React頁面吧Django Admin是現成的、可定制的、帶權限的——學生只需在admin.py里注冊Model加幾行list_display后臺就有了。FastAPI要實現同等功能至少多寫200行代碼。技術選型不是比誰新而是比誰讓項目在兩周內穩定交付。3. 核心模塊詳解從抓取到存儲的每一步實操細節3.1 京東爬蟲模塊如何繞過基礎反爬拿到真實HTML京東的反爬不是靠復雜算法而是組合式HTTP層攔截。requests發請求時必須同時滿足四個條件缺一不可User-Agent必須是真實瀏覽器標識不能用requests默認的python-requests/2.31.0京東會直接返回403。要用fake-useragent生成隨機UA但注意——fake-useragent的Chrome UA有時帶HeadlessChrome字樣京東會拒絕。實測有效的UA是headers { User-Agent: Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/115.0.0.0 Safari/537.36, Accept: text/html,application/xhtmlxml,application/xml;q0.9,image/avif,image/webp,image/apng,*/*;q0.8,application/signed-exchange;vb3;q0.7, Accept-Language: zh-CN,zh;q0.9,en;q0.8, Accept-Encoding: gzip, deflate, br, Connection: keep-alive, Upgrade-Insecure-Requests: 1, Sec-Fetch-Dest: document, Sec-Fetch-Mode: navigate, Sec-Fetch-Site: none, Sec-Fetch-User: ?1, Cache-Control: max-age0, }這里Accept-Encoding: gzip, deflate, br是關鍵——京東返回的HTML是br壓縮的如果你沒聲明支持br它可能返回空響應。requests默認不支持br壓縮必須裝brotli庫pip install brotli。Referer必須是京東站內URL直接訪問商品頁https://item.jd.com/1000123456.html會返回403必須帶上Referer比如搜索頁https://search.jd.com/Search?keyword手機。實測發現Referer不必完全匹配但域名必須是jd.com路徑可以是任意子路徑。Cookies需包含pt_key和pt_pin京東登錄態由這兩個cookie維持。未登錄時pt_key是空值但pt_pin必須存在值為xxx否則返回403。解決方案用requests.Session()先GET一次京東首頁它會自動設置基礎cookies再發商品頁請求session requests.Session() session.get(https://www.jd.com, timeout10) response session.get(https://item.jd.com/1000123456.html, headersheaders, timeout10)請求頻率必須可控京東對單IP有QPS限制超過3次/秒大概率觸發驗證碼。解決方案不是加time.sleep(1)而是用requests.adapters.HTTPAdapter的池連接session.mount(https://, requests.adapters.HTTPAdapter( pool_connections10, pool_maxsize10, max_retries3 ))這樣10個連接復用比單連接頻繁創建更隱蔽。提示京東商品頁的HTML結構每天都在變。不要寫死CSS選擇器比如soup.select(span.p-price)而要用soup.find_all([span, i], class_re.compile(rp-price|J_price|price))。正則匹配比精確匹配容錯率高3倍。3.2 數據解析模塊從HTML到結構化數據的清洗邏輯京東商品頁的數據分布在三個地方必須全部抓取并關聯主價格區在div classprice里價格文本可能是¥999.00或i¥/iem999.00/em用正則r¥(\d\.\d{2})提取最穩。銷量區在div idcomment-count里文本是已有10萬人評價用正則r已有(\d)(?:萬\?)?人評價再轉成整數int(m.group(1)) * 10000 if 萬 in text else int(m.group(1))。JSON數據區在script標簽里window.__INITIAL_STATE__ {...}用re.search(rwindow\.__INITIAL_STATE__ (.*?);, html)提取然后json.loads()。這里面有商品標題、店鋪ID、SPU編碼比HTML里更全。清洗時的三大陷阱價格單位混淆有些商品標價是“¥999”有些是“999元”正則必須統一提取數字部分再補上.00。錯誤做法float(price_str.replace(¥, ).replace(元, ))正確做法Decimal(re.search(r(\d\.\d{2}|\d), price_str).group(1) or 0.00)。銷量文本格式多樣除了“10萬”還有“1.2萬”、“5000”、“已售罄”。清洗函數必須覆蓋def parse_sales(text): if not text: return 0 if 萬 in text: num float(re.search(r(\d\.?\d*), text).group(1)) return int(num * 10000) elif in text: return int(re.search(r(\d), text).group(1)) elif 售罄 in text: return 0 else: return int(re.search(r(\d), text).group(1))店鋪名重復問題京東自營店叫“京東自營”第三方店叫“XX旗艦店”但同一個店鋪可能有多個ID。Django Model里店鋪字段必須設uniqueTrue插入前先Shop.objects.get_or_create(nameshop_name)避免數據庫唯一鍵沖突。3.3 數據庫設計為什么字段類型比表結構更重要Django的models.py不是隨便寫的每個字段類型都對應真實業務約束class Product(models.Model): # 商品ID必須是京東原始ID不能自增因為要跨店鋪比價 jd_id models.CharField(max_length32, uniqueTrue, db_indexTrue) # 加索引加速查詢 # 標題用TextField因為可能超255字符 title models.TextField() # 價格必須用Decimal精度強制兩位小數 price models.DecimalField(max_digits10, decimal_places2) # 銷量用BigIntegerField因為10萬轉成100000int可能溢出 sales models.BigIntegerField(default0) # 評論數同理京東有商品評論超千萬 comments models.BigIntegerField(default0) # 店鋪外鍵關聯Shop模型 shop models.ForeignKey(Shop, on_deletemodels.CASCADE) # 上架時間自動記錄 created_at models.DateTimeField(auto_now_addTrue) # 更新時間每次爬取更新 updated_at models.DateTimeField(auto_nowTrue) class Meta: ordering [-created_at] # 默認按時間倒序 verbose_name 商品 verbose_name_plural 商品 class Shop(models.Model): name models.CharField(max_length100, uniqueTrue) # 店鋪名唯一 jd_shop_id models.CharField(max_length32, blankTrue) # 京東店鋪ID可能為空 class Meta: verbose_name 店鋪 verbose_name_plural 店鋪關鍵細節jd_id設uniqueTrue且db_indexTrue京東商品ID是自然主鍵比Django默認的id字段更實用——比價時直接用jd_id關聯不同店鋪的商品不用JOIN。price用DecimalFieldmax_digits10表示總共10位數字含小數點decimal_places2強制兩位小數。如果用FloatField存99.90可能變成99.89999999999999排序和求和都會錯。sales和comments用BigIntegerFieldMySQL的INT最大值是2147483647京東手機銷量超500萬但“10萬”轉成100000沒問題可一旦有商品銷量破億INT就溢出了。BigIntegerField對應MySQL的BIGINT安全上限9223372036854775807。created_at和updated_at用auto_now_add和auto_nowDjango自動維護不用在爬蟲腳本里寫datetime.now()避免時區錯誤。注意Django的makemigrations命令生成的SQL在MySQL里可能不兼容。比如DecimalField在MySQL 5.7以下版本會報錯必須手動改SQL把decimal(10,2)改成decimal(10,2) DEFAULT NULL。這是學生最容易卡住的點——migration成功migrate失敗報錯Invalid default value for price。3.4 Django業務邏輯比價功能如何用ORM寫出可讀代碼比價不是簡單SELECT MIN(price)而是按商品ID聚合取各店鋪最新價格再比最低價。用原生SQL寫SELECT jd_id, shop_id, price, MAX(created_at) as latest_time FROM myapp_product GROUP BY jd_id, shop_id ORDER BY latest_time DESC LIMIT 1;但Django ORM更清晰from django.db.models import Max, OuterRef, Subquery def get_latest_prices(): # 先查每個商品ID店鋪的最新記錄ID latest_ids Product.objects.values(jd_id, shop).annotate( latest_idMax(id) ).values(latest_id) # 再用這些ID查完整記錄 latest_products Product.objects.filter( id__inSubquery(latest_ids) ).select_related(shop) # 按jd_id分組找最低價 result {} for product in latest_products: if product.jd_id not in result: result[product.jd_id] { title: product.title, min_price: product.price, cheapest_shop: product.shop.name, all_shops: [] } result[product.jd_id][all_shops].append({ shop: product.shop.name, price: float(product.price), sales: product.sales }) if product.price result[product.jd_id][min_price]: result[product.jd_id][min_price] product.price result[product.jd_id][cheapest_shop] product.shop.name return result這段代碼可讀性高且能在Django shell里直接測試python manage.py shell from myapp.utils import get_latest_prices get_latest_prices()比價結果返回字典前端直接JSON序列化即可。關鍵點不要在View里寫復雜SQL把邏輯封裝成獨立函數這樣單元測試、緩存、異步調用都方便。4. 實操全流程從零開始搭建可運行系統的完整步驟4.1 環境準備三步搞定本地開發環境Python環境必須3.8京東頁面大量使用ES6語法舊版Python的requests可能不兼容HTTPS證書。用pyenv裝3.10# macOS brew install pyenv pyenv install 3.10.12 pyenv global 3.10.12Windows用戶直接下載Python 3.10安裝包勾選“Add Python to PATH”。Django與依賴安裝創建requirements.txt明確版本Django4.2.7 requests2.31.0 beautifulsoup44.12.2 fake-useragent1.4.0 mysqlclient2.2.0 brotli1.1.0 djangorestframework3.14.0執行pip install -r requirements.txt。注意mysqlclient安裝可能報錯Windows需先裝Visual Studio Build ToolsmacOS需brew install mysql-client。MySQL配置本地開發用Docker最穩不用手動裝MySQL用Dockerdocker run -d \ --name jd-mysql \ -p 3306:3306 \ -e MYSQL_ROOT_PASSWORDroot123 \ -e MYSQL_DATABASEjddata \ -v /path/to/mysql/data:/var/lib/mysql \ -d mysql:8.0然后在Django的settings.py里配置DATABASES { default: { ENGINE: django.db.backends.mysql, NAME: jddata, USER: root, PASSWORD: root123, HOST: 127.0.0.1, PORT: 3306, OPTIONS: { init_command: SET sql_modeSTRICT_TRANS_TABLES, }, } }4.2 初始化項目Django項目骨架與核心App創建創建項目與Appdjango-admin startproject jdbijia . python manage.py startapp crawler python manage.py startapp product在settings.py里注冊AppINSTALLED_APPS [ django.contrib.admin, django.contrib.auth, django.contrib.contenttypes, django.contrib.sessions, django.contrib.messages, django.contrib.staticfiles, rest_framework, crawler, product, ]定義Models并生成Migration在product/models.py寫完Product和Shop模型后執行python manage.py makemigrations python manage.py migrate如果報錯django.core.exceptions.ImproperlyConfigured: Error loading MySQLdb module說明mysqlclient沒裝好回到4.1重裝。創建超級用戶并啟動Adminpython manage.py createsuperuser python manage.py runserver訪問http://127.0.0.1:8000/admin用剛建的賬號登錄就能看到空的Product和Shop列表——這是驗證數據庫連通性的第一步。4.3 爬蟲腳本編寫一個可單獨運行的爬蟲命令Django支持自定義management command把爬蟲做成python manage.py crawl_jd --keyword手機在crawler/management/commands/crawl_jd.py寫from django.core.management.base import BaseCommand from crawler.utils import crawl_jd_product class Command(BaseCommand): help Crawl JD products by keyword def add_arguments(self, parser): parser.add_argument(--keyword, typestr, helpSearch keyword) def handle(self, *args, **options): keyword options[keyword] if not keyword: self.stdout.write(Please provide --keyword) return crawl_jd_product(keyword) self.stdout.write(fSuccessfully crawled {keyword})在crawler/utils.py寫核心爬取邏輯import requests from bs4 import BeautifulSoup import re import json from product.models import Product, Shop def crawl_jd_product(keyword): # 1. 搜索頁獲取商品ID列表 search_url fhttps://search.jd.com/Search?keyword{keyword} headers {...} # 同3.1節 session requests.Session() session.get(https://www.jd.com) response session.get(search_url, headersheaders) soup BeautifulSoup(response.text, html.parser) item_ids [] for item in soup.select(li.gl-item): data_sku item.get(data-sku) if data_sku: item_ids.append(data_sku) # 2. 遍歷商品ID抓詳情頁 for jd_id in item_ids[:10]: # 先抓10個測試 detail_url fhttps://item.jd.com/{jd_id}.html response session.get(detail_url, headersheaders) if response.status_code ! 200: continue # 解析價格、銷量、店鋪 price parse_price(response.text) sales parse_sales(response.text) shop_name parse_shop(response.text) # 存庫 shop, _ Shop.objects.get_or_create(nameshop_name) Product.objects.update_or_create( jd_idjd_id, defaults{ title: parse_title(response.text), price: price, sales: sales, shop: shop, } )運行命令python manage.py crawl_jd --keyword手機等待2分鐘刷新Admin后臺Product列表里就會出現商品——這是系統跑通的第一個里程碑。4.4 API接口開發用DRF暴露比價結果安裝DRF并配置在settings.py加REST_FRAMEWORK { DEFAULT_PAGINATION_CLASS: rest_framework.pagination.PageNumberPagination, PAGE_SIZE: 20, DEFAULT_RENDERER_CLASSES: [ rest_framework.renderers.JSONRenderer, ], }寫Serializer和View在product/serializers.pyfrom rest_framework import serializers from .models import Product, Shop class ProductSerializer(serializers.ModelSerializer): shop_name serializers.CharField(sourceshop.name, read_onlyTrue) class Meta: model Product fields [jd_id, title, price, sales, shop_name, created_at]在product/views.pyfrom rest_framework.views import APIView from rest_framework.response import Response from .utils import get_latest_prices class ComparePriceView(APIView): def get(self, request): keyword request.query_params.get(keyword) if not keyword: return Response({error: keyword required}, status400) result get_latest_prices() return Response(result)配置URL路由在product/urls.pyfrom django.urls import path from . import views urlpatterns [ path(api/compare/, views.ComparePriceView.as_view(), namecompare-price), ]在主urls.py includeurlpatterns [ path(admin/, admin.site.urls), path(, include(product.urls)), ]測試API啟動服務后用curl測試curl http://127.0.0.1:8000/api/compare/?keyword手機返回JSON格式的比價結果前端可直接消費。5. 常見問題與避坑指南那些讓你debug三天的隱藏雷區5.1 requests報錯排查速查表報錯信息根本原因解決方案Connection refused京東服務器拒絕連接通常是IP被封換代理IP或降低請求頻率加time.sleep(2)SSLError: certificate verify failedPython證書庫過期執行pip install --upgrade certifiReadTimeout京東響應慢超時未返回把timeout10改成timeout(10, 30)連接10秒讀取30秒JSONDecodeError解析__INITIAL_STATE__時JSON格式錯誤用try...except捕獲打印原始HTML定位問題位置AttributeError: NoneType object has no attribute textBeautifulSoup找不到元素HTML結構變了改用find_all()加正則或加默認值soup.find(span) or 實操心得京東反爬升級后__INITIAL_STATE__可能被加密或拆分成多個變量。這時別硬解直接用soup.select(span.p-price)抓HTML里的價格準確率95%以上。技術選型要務實不是越復雜越好。5.2 Django數據庫常見故障現象原因解決方案django.db.utils.IntegrityError: (1062, Duplicate entry xxx for key product_product.jd_id)商品ID重復插入Product.objects.update_or_create(jd_idxxx, defaults{...})替代create()django.core.exceptions.FieldError: Cannot resolve keyword price into fieldModel字段名寫錯或用了保留字檢查price是否和Django內置字段沖突改名jd_pricedjango.db.utils.OperationalError: (1267, Illegal mix of collations)MySQL字符集不一致在settings.py DATABASES里加OPTIONS: {charset: utf8mb4}django.core.exceptions.ImproperlyConfigured: Error loading MySQLdb modulemysqlclient沒裝好Windows裝Microsoft Visual C Build ToolsmacOSbrew install mysql-client pip install mysqlclient5.3 畢設答辯高頻問題預判與回答Q京東有反爬你們怎么保證數據持續可用A我們沒做“永久可用”而是做“可維護”。爬蟲腳本里所有CSS選擇器都用正則HTML結構一變改一行正則就行所有請求頭都封裝在config.py里反爬策略升級時集中修改這里。答辯時可以現場演示把p-price改成J_price重新運行爬蟲數據照常入庫。Q比價結果準確嗎怎么驗證A我們做了三重驗證1Admin后臺人工抽查看價格和銷量是否和京東頁面一致2寫單元測試用固定HTML文件做解析斷言價格提取正確3部署后每天定時爬10個商品郵件發送比價報告連續一周無誤差才算通過。Q數據庫設計為什么不用NoSQLA因為比價是強關系查詢——要查“同一商品ID在不同店鋪的價格”這需要JOIN和GROUP BYMySQL的B樹索引比MongoDB的文檔掃描快10倍。NoSQL適合日志、消息隊列不適合電商比價這種事務型場景。Q代碼開源嗎A核心邏輯已開源在GitHub可提供鏈接但京東的cookies和User-Agent池做了脫敏處理因為涉及賬號安全。學生交畢設時這部分用占位符代替不影響功能演示。6. 項目擴展建議從畢設到真實產品的進階路徑這個系統不是終點而是起點。如果想把它變成真實可用的產品有三條清晰路徑增加監控告警用APScheduler定時任務每天凌晨爬一次熱門商品如果某商品價格波動超10%自動發郵件給管理員。代碼只需10行from apscheduler.schedulers.background import BackgroundScheduler from django.core.mail import send_mail def check_price_change(): products Product.objects.filter(created_at__gtetimezone.now()-timedelta(days1)) for p in products: yesterday Product.objects.filter(jd_idp.jd_id, created_at__ltp.created_at).order_by(-created_at).first() if yesterday and abs(p.price - yesterday.price) / yesterday.price 0.1: send_mail(價格異動, f{p.title}價格變動{abs(p.price - yesterday.price)}, fromexample.com, [adminexample.com]) scheduler BackgroundScheduler() scheduler.add_job(check_price_change, interval, hours24) scheduler.start()接入微信小程序Django REST API天然支持小程序。小程序端用wx.request調用/api/compare/?keyword手機返回JSON后用wx:for渲染列表。難點在登錄態——小程序用wx.login()獲取code后端用https://api.weixin.qq.com/sns/jscode2session換openId存進Django User表實現賬號體系。部署到云服務器用NginxGunicorn部署比本地runserver穩定百倍。Dockerfile示例FROM python:3.10-slim WORKDIR /app COPY requirements.txt . RUN pip install -r requirements.txt COPY . . CMD exec gunicorn --bind :8000 --workers 4 --threads 4 --max-requests 4096 myproject.wsgi:application部署后用docker-compose.yml一鍵啟MySQLDjangoNginx學生答辯時演示“線上系統”比本地localhost高級得多。最后分享一個小技巧京東商品ID不是隨機的前幾位代表品類。比如1000開頭的是手機2000開頭的是電腦。爬蟲時可以按ID段分批抓取避免全網掃蕩觸發風控。這個規律在京東開放平臺文檔里有寫但很少有人注意——真正的工程能力就藏在這些文檔縫隙里。本文還有配套的精品資源點擊獲取