站的小說,離線隨時(shí)讀)
novel-downloader 使用指南批量下載 100 網(wǎng)站的小說離線隨時(shí)讀【免費(fèi)下載鏈接】novel-downloader一個(gè)可擴(kuò)展的通用型小說下載器。項(xiàng)目地址: https://gitcode.com/gh_mirrors/no/novel-downloadernovel-downloader 是一款跑在瀏覽器腳本管理器里的小說下載器打開支持網(wǎng)站的書籍目錄頁點(diǎn)一下右上角出現(xiàn)的下載圖標(biāo)它就開始逐章抓取最后把整本書整理成 TXT 和 EPUB 兩個(gè)文件存進(jìn)你的電腦。下面跟著一本書走完全程——從網(wǎng)頁上的目錄到你閱讀設(shè)備里的文件。兩分鐘裝好 novel-downloader它不是需要單獨(dú)安裝的程序而是一個(gè)小說爬蟲腳本油猴用戶腳本靠腳本管理器驅(qū)動。所以第一步是給瀏覽器裝腳本管理器——一個(gè)負(fù)責(zé)運(yùn)行這類自定義腳本的插件Chrome 上常用 Tampermonkey開源的有 ViolentmonkeyFirefox 用 Greasemonkey三選一即可。裝好后新建一個(gè)腳本、粘貼官方腳本內(nèi)容并保存就算裝上了。如果你習(xí)慣從源碼編譯一份自己的克隆倉庫后構(gòu)建git clone https://gitcode.com/gh_mirrors/no/novel-downloader cd novel-downloader yarn install yarn builddist 目錄里會出一個(gè) bundle.user.js導(dǎo)入腳本管理器就能用。從目錄頁右上角的下載圖標(biāo)開始打開支持網(wǎng)站的目錄頁腳本先判斷這個(gè)頁面它認(rèn)不認(rèn)識。認(rèn)識右上角就浮出一個(gè)下載圖標(biāo)點(diǎn)它批量下載小說就跑起來了。接下來是等。右下角有進(jìn)度條按 F12 能在控制臺看到每一章的抓取日志開始下載保存文件一條條滾過去。章節(jié)里的圖片也會一并下載、嵌回原來的位置。有個(gè)小細(xì)節(jié)下載過程中腳本會放一段無聲音頻防止瀏覽器把后臺標(biāo)簽頁休眠掉聽到提示音別慌。100 網(wǎng)站每個(gè)都有自己的說明書起點(diǎn)、晉江、刺猬貓、カクヨム、小説家になろう還有滿大街的筆趣閣系列頁面結(jié)構(gòu)各不相同。novel-downloader 的辦法是每個(gè)站一份獨(dú)立的解析規(guī)則統(tǒng)一放在 網(wǎng)站解析規(guī)則目錄 下按單頁、雙頁、特殊處理等類型分文件夾存放。下載時(shí)腳本拿當(dāng)前網(wǎng)址匹配到對應(yīng)規(guī)則再按規(guī)則寫好的選擇器找書名、章節(jié)列表和正文容器。某個(gè)站改版了只需要動那一個(gè)規(guī)則文件核心抓取流程集中在 核心業(yè)務(wù)邏輯規(guī)則只管東西在哪不管怎么抓。文字藏在圖片里三層解碼有一類站防抓取防得很極端正文逐字替換成小圖片肉眼正常復(fù)制出來全是碎片。腳本對這種局面準(zhǔn)備了一套由快到慢的兜底 文件名映射不少站給字符圖的文件名就是對應(yīng)的字先看文件名能對上就零成本解決哈希匹配文件名對不上就把圖片下載下來算指紋哈希值拿去匹配表里查PaddleOCR 識別前兩步都落空的圖片交給 OCR 模型真正讀一遍首次使用會自動下載模型文件。絕大多數(shù)章節(jié)走前兩層就解決了只有真正的新面孔才落到 OCR 上。晉江的字體加密怎么還原成正常中文晉江文學(xué)城、番茄這類站還有一招頁面加載的是偽裝的自定義字體字形和真漢字對不上屏幕看著正常源碼里卻是別的字符。腳本會跟著頁面把字體文件下載下來解析字形、建立偽字符 → 真漢字的映射表再把正文逐個(gè)替換回去——這就是晉江字體解密的原理落地的文檔就是正常中文。如果下載后仍見零星怪符號多半是遇到了匹配表里還沒有的新字體打開調(diào)試模式日志會提示字體鏈接按提示反饋即可。下載落成 TXT 和 EPUB離線隨時(shí)讀完成后兩個(gè)文件自動落到下載目錄。TXT 用任何文本編輯器都能打開適合丟進(jìn)手機(jī)自帶閱讀器EPUB 是帶目錄、分卷、排版的電子書格式把多平臺小說轉(zhuǎn)成 EPUB 之后Kindle、Calibre 直接導(dǎo)入地鐵里信號斷了也能接著上次的位置翻。分卷小說會保留卷的層級結(jié)構(gòu)卷首分隔頁、目錄跳轉(zhuǎn)都在。不喜歡默認(rèn)排版的話腳本預(yù)留了自定義篩選函數(shù)和保存參數(shù)只下載前 100 章、按關(guān)鍵詞篩章節(jié)、改章節(jié)標(biāo)題格式都行相關(guān)實(shí)現(xiàn)在 保存與格式模塊。卡住或亂碼按順序查這四件事先說前提付費(fèi)章節(jié)需要先登錄網(wǎng)站賬號并確認(rèn)已購買沒登錄或沒買的部分下載時(shí)會被直接跳過這是設(shè)計(jì)行為不是故障。站點(diǎn)是否真的在支持列表——不在列表的站右上角不會出現(xiàn)圖標(biāo)這是最常見的沒反應(yīng)按 F5 刷新一次——長佩、pixiv 這類單頁應(yīng)用有時(shí)重載之后圖標(biāo)才出現(xiàn)設(shè)置里開調(diào)試模式再下一次看生成 zip 里的 debug.log能區(qū)分是抓取、解碼還是格式的問題反爬嚴(yán)的站長佩限制每分鐘幾章就把并行線程調(diào)小、間隔調(diào)大慢但穩(wěn)。想加新站寫一個(gè)規(guī)則文件這就是模塊化架構(gòu)的好處支持一個(gè)新網(wǎng)站不用碰下載引擎在 src/rules/ 對應(yīng)類型的目錄里新建一個(gè)規(guī)則文件繼承基礎(chǔ)規(guī)則類寫清書名在哪、章節(jié)列表在哪、正文容器在哪再把網(wǎng)址匹配模式登記進(jìn)腳本重新構(gòu)建就完事。倉庫里現(xiàn)有的 100 多個(gè)站都是一個(gè)文件一個(gè)文件加出來的。想加站、報(bào)問題或者發(fā)現(xiàn)哪個(gè)站又改版了歡迎到項(xiàng)目倉庫的 issue 區(qū)留言也可以直接提交你的規(guī)則文件。請只下載你已購買或有權(quán)閱讀的內(nèi)容。【免費(fèi)下載鏈接】novel-downloader一個(gè)可擴(kuò)展的通用型小說下載器。項(xiàng)目地址: https://gitcode.com/gh_mirrors/no/novel-downloader創(chuàng)作聲明:本文部分內(nèi)容由AI輔助生成(AIGC),僅供參考