下載、探勘、餵給 AI,
是三種不同的權利。
(「下載」=把檔案抓下來;「探勘/TDM」=讓電腦一次讀大量文獻自動分析;「餵給 AI」=把內容交給 ChatGPT 這類工具。)
你還是可以合法用 AI,這頁教你怎麼用得安心。給政大師生的實用指引:搞懂「從資料庫下載的文章,能不能交給 AI 摘要、翻譯或改寫」,往下可查條款、跑決策流程、看法律依據。
- 可以用資料庫「內建」的 AI(如 Scopus AI、JSTOR,本館另有專頁)、你自己寫的東西、公共領域或開放取用內容。
- 要小心把訂閱文章「全文」貼給外部 AI(ChatGPT 等),多半違反資料庫條款;先查條款,或只貼重點、自己的筆記。
- 別做用爬蟲/機器人大量下載全文(19 個資料庫幾乎都禁止),或把盜版、來源不明的檔案餵 AI。
- 想確認自己的情況?下面的自我檢測,選一選就知道。
自我檢測:能不能上傳給 AI?
先給你一個快速自我檢測:選一選你的情況,馬上出建議;想看依據,往下都有完整說明。
比較安全的做法
現實層面:就目前公開資訊,尚少見到因個人研讀而把單篇 PDF 貼進 AI 就被追訴的案例,個人非商業研究也有主張合理使用的空間;但「少見被訴」不等於「明確合法」,而且合約的違反、與著作權能否主張合理使用,是兩回事。
用機構已授權、且不訓練/不保留的工具
企業或教育版、明確不儲存也不拿去訓練者,風險最低;避免用會保存或抓取內容的免費工具。國科會指引 ↗
用資料庫「內建」的 AI 功能
如 ScienceDirect 閱讀助手、Ovid、ProQuest 研究助手,出版社已自行授權。本館 · 資料庫 AI 功能 ↗
用開放取用/CC 授權內容
仍要看 CC 條款;NC/ND 對商業性 AI 平台可能不相容。Creative Commons ↗
不要上傳全文
貼你自己的筆記、少量引文或重點,而非整篇 PDF。數發部手冊 ↗
需要時取得授權
不確定特定資料庫的允許範圍時,直接向出版社或資料庫平台確認、或申請授權。往下查條款 ↓
上傳前先停一下
按下夾檔前,先確認是否涉及著作權、隱私或機密。數發部手冊 ↗
資料庫不給的時候,合法怎麼做?
很多人需要大量文本,是為了做數位人文、文獻計量或訓練模型,並非要盜版。與其自己爬、或把全文丟外部 AI,這裡按「你想做什麼 → 改走哪條合法路」整理。(實際可用範圍仍以你機構的授權與各平台條款為準。)
想大量下載/自己寫爬蟲?
- 官方 TDM API:合法訂閱者可到 Elsevier ScienceDirect API 申請 API Key,在速率限制內擷取全文與摘要;Crossref TDM API 可統一取多家期刊的中繼資料與 TDM 存取,比自己爬蟲風險低很多。
- 雲端分析(不必把全文下載到本地):學校若有採購 ProQuest TDM Studio,可用其介面或 Jupyter Notebook 做大量文獻探勘;JSTOR 也提供官方文字分析服務(Constellate 已於 2025/7 停用、由 JSTOR Text Analysis Support 接手)。HathiTrust HTRC 則採「非消耗性研究」:把演算法送進安全伺服器運算、或只釋出統計特徵資料集,受版權保護的全文完全不外流。
想訓練模型/做 RAG/建本地知識庫?
- OpenAlex:2.5 億筆以上學術中繼資料,開源、免費 API,社群也已做成 MCP,目前讓 AI 合法檢索學術脈絡的最佳替代。
- PubMed Central OA Subset/arXiv/Europe PMC:數百萬篇允許機器讀取的開放全文。
- CORE/Unpaywall:想找某篇付費論文,可用它們找合法的 Green OA(作者自存版)。
只是想請 AI 幫忙綜整、梳理?
- 用中繼資料代替全文:從 WOS/Scopus 匯出書目檔(RIS/CSV,含標題、摘要、關鍵字),把這些沒有全文重製爭議的摘要交給 AI 做主題分群或趨勢梳理。
- 引文筆記法:在 Zotero/EndNote 摘記核心概念與方法,只把「你自己的筆記」或少量段落給 AI,避開重製與合約爭議。
非用 AI 分析全文不可?
- 資料庫原廠 AI:如 Scopus AI、Web of Science Research Assistant,底層已獲出版商授權、附引用回溯,最省事也最合規。
- 本地離線模型(Ollama/LM Studio):在自己電腦離線運行,不把資料傳給第三方伺服器(無第三方揭露風險),合規上優於傳到 OpenAI/Anthropic 的公有雲。
同一個資料庫,能不能「大量下載」、能不能做「文字探勘(TDM)」、能不能把內容「交給外部生成式 AI/RAG」,往往分屬三套規定。這張表把 19 個常用學術與新聞資料庫的公開條款拆成這三欄,讓你先看結論、再看原文。
19 個資料庫都不允許自行以爬蟲、機器人批次抓取。
可行者也須合法近用、非商業、走指定 API 或合約。
最好的情況也只是「需另行授權」,多數直接禁止。
這是條款整理,不是法律意見。校方簽署的機構授權合約、個別產品條款、開放取用授權(如 CC BY)可能另有規定或優先適用。正式使用前,請再向原出版社或資料庫平台確認。
資料庫怎麼規定
點任一列展開,看白話說明、條款原文和官方連結。(「文字探勘/TDM」=讓電腦一次讀大量文獻自動分析,不是人工一篇篇讀。)
- 拿到哪種近用權?校園訂閱、個人帳號、開放取用或 API,能做的事不同。
- 要的是全文,還是中繼資料?能抓 DOI/摘要,不代表能抓 PDF 全文。
- 用途是非商業研究嗎?多數 TDM 例外只給非商業研究。
- 資料會離開核准環境嗎?上傳外部 AI/向量庫,是新的複製與揭露。
- 合約有沒有寫到 AI/RAG?傳統 TDM 授權不當然涵蓋訓練、RAG、微調。
搞懂規則:著作權、判例、各國怎麼管
條款寫「遵循著作權法」,但著作權是另一套規則。這一段把「合約」和「著作權」兩層分開講清楚,再帶你看 2026 的判例和各國法規。以下為一般性說明,幫助你判斷方向,不是個案法律意見;遇到具體情況請諮詢專業。
資料庫授權條款
通常是最直接的限制。如同上方比較表所示,多數資料庫條款禁止或限制把全文交給外部 AI,這一層即使著作權上可能主張合理使用,合約仍可能另外限制。「圖書館買的是授權,不是你個人擁有內容。」不過合約層也能反過來爭取:英國 Jisc(代表各大學談判)2024 年即呼籲大學堅拒過度限制的 AI 條款,以捍衛師生合法的研究輔助與非商業探勘。
重製、改作、合理使用
把全文上傳到 AI,在 AI 開始摘要之前,動作通常已產生一份重製物、並把內容交給了第三方。在台灣著作權法上,這通常會構成一次「重製」行為(§3);是否構成侵權,還要看有沒有授權或合理使用(§44–65,須逐案判斷)。放到國際看更清楚:日本常被說是「AI 最寬鬆」的地方,因為它有一條「資訊解析」例外(§30-4)。但日本文化廳 2024 年講明:如果那個資料庫本來就是「賣來做分析用」的,你擅自爬取、或為了做 RAG 把它向量化,都算「不當損害權利人利益」,一樣不能免責。可見資料庫的授權條款,就算碰上最寬鬆的著作權例外,仍然擋得住。
三種用法,風險從低到高
一個通則:AI 吐出來的東西如果跟原文「很像」就會侵權。純粹講事實、觀念的摘要通常沒事;越接近逐字翻譯、或照著改寫,就越危險。
輔助閱讀、摘要
「上傳通常涉及重製」是主要風險點;為個人理解而生的抽象摘要,輸出端風險較低(著作權保護表達、不及於觀念)。但上傳全文這個動作仍是重製與第三方揭露。
§3 重製 · §10-1 觀念/表達翻譯
翻譯屬於「改作」,是著作人專有權利,成果為衍生著作。個人自用較有空間,但一旦散布、或譯文實質重現原文表達,即落入需授權範圍。
§28 改作 · §3(1)(11)改寫
改寫多屬改作/衍生著作,越接近「可替代原文」,合理使用第四要件(市場影響)越不利,尤其若成果被分享或再利用。
§28 改作 · §65 市場影響指標判例(含台灣首例):「怎麼取得」最關鍵;就算非商業、開源分享,未授權整批重製仍可能觸法(點開看案例)
先講清楚:國外那幾件多是在告「AI 公司」怎麼訓練模型,對台灣法院沒有約束力,只是讓你了解國際爭點。但台灣已經有第一件,而且是告「個人」、走刑事,那件最該看。
中央社 v. 台大博士生(台灣首例)
一名台大博士生為補足繁體中文語料,把網路文本整理成開源資料集「fineweb-zhtw」、無償公開於 Hugging Face,卻含約 14 萬筆未授權的中央社新聞(2011–2021)。中央社 2025/7 提起著作權侵害刑事告訴,後雙方和解,法院未及表態。
Bartz v. Anthropic(15 億美元和解)
美國史上最大著作權和解案。法官 Alsup 在簡易判決中曾初步認為:用「合法取得」的書訓練 AI 可能有合理使用空間,但從盜版庫「下載取得」則構成侵權。惟本案隨後達成和解,此見解未經上訴審查、尚未形成全國性判例;和解本身也僅處理「取得/輸入端」。
Elsevier 等 v. Meta
五大學術與教育出版社(Elsevier、Cengage、Hachette、Macmillan、McGraw Hill)與作家 Scott Turow,提告 Meta 與 Zuckerberg,主張其從盜版書庫下載、並爬取付費牆後的數百萬本書與期刊論文訓練 Llama,且移除著作權管理資訊(CMI)以掩飾來源。這是出版社首度對 AI 公司提起的著作權訴訟(案號 1:26-cv-03689)。
New York Times v. OpenAI/Microsoft
紐約時報告 OpenAI 與微軟,主張其未經授權用數百萬篇報導訓練 ChatGPT,且 ChatGPT 會近乎逐字重現報導、損害訂閱。2025/4 法院駁回大部分「駁回動議」、核心著作權主張存續;2026/1 更裁定 OpenAI 須交出 2,000 萬筆 ChatGPT 對話紀錄。案號 1:23-cv-11195,尚在審理。
Dow Jones/紐約郵報 v. Perplexity
華爾街日報母公司道瓊與紐約郵報,告 AI 答案引擎 Perplexity,主張其爬取繞過付費牆、把受版權文章存入向量庫做 RAG,回答時大量重現原文、讓使用者「skip the links」不再點進原網站,形成市場替代。案號 1:24-cv-07984,審理中。
台灣官方指引怎麼說
數位發展部《公部門人工智慧應用參考手冊》(2026/1)與國科會《行政院及所屬機關(構)使用生成式 AI 參考指引》(2023/10)雖是寫給政府機關,但這些原則對校園師生一體適用,也正好替本頁的提醒背書。
- 會用到哪些法:政府盤點,AI 應用觸及《人工智慧基本法》《個人資料保護法》《著作權法》《商標法》《專利法》《營業秘密法》。(手冊 1.6)
- 資料要乾淨:訓練與使用的資料,應排除侵害著作權與個資的相關資料。(手冊檢核 2.3.2)
- 現成 AI 會「吃」資料、機密別餵:現成生成式 AI 服務提供的資料「有可能被服務提供商直接再次使用」;不要在公開或 API 串接的服務輸入個人或機密資料,機密文書更應親自撰寫、禁用生成式 AI。(手冊 3.1.3、4.3.6;國科會指引)
- 要守服務條款:使用時應遵守 AI 服務的相關使用條款,確保法令遵循。(手冊 4.2.7)
- 別把 AI 當專家、也別全信:法律、醫學等要求精確的領域,不應把生成式 AI 當作專家的替代方案;產出須由人做客觀且專業的最終判斷、不可完全信任。(手冊 p.9;國科會指引)
台灣還有這些 AI 相關法規與指引(依數發部手冊第 20 頁整理)
下列依數位發展部《公部門 AI 應用參考手冊》整理。多為特定領域指引;與「用資料庫+AI」最相關的是《著作權法》與文化部的生成式 AI 指引。
相關法律
- 《人工智慧基本法》(2025/12 三讀通過、2026/1 施行,上位原則)、《個人資料保護法》、《著作權法》、《商標法》、《專利法》、《營業秘密法》。
行政指導(跨機關通用)
- 數位發展部數位產業署《AI 產品與系統評測參考指引(草案)》(2024/3)
- 國科會《行政院及所屬機關(構)使用生成式 AI 參考指引》(2023/10)
- 臺北市政府《使用人工智慧作業指引》(2024/9)
產業指導(特定領域)
- 文化部《文化藝術應用生成式 AI 指引》(2025/7),與創作、著作權較相關。
- 金管會《金融業運用人工智慧(AI)指引》(2024/6)
- 衛福部《AI/機器學習醫療器材軟體 PCCP 申請要點暨撰寫說明指引》(2024/9)
政策白皮書
- 行政院《晶片驅動臺灣產業創新方案》(2023/11)
- 金管會《金融業運用 AI 之核心原則與相關推動政策》(2023/10)
- 行政院《臺灣 AI 行動計畫 2.0》(2023/2)
想深入?以下為選讀的延伸背景。
另一個問題:AI 生成的東西,著作權算誰的?
前面談的是「輸入端」(能不能拿內容餵 AI);這裡是「輸出端」,AI 幫你生成、翻譯或改寫的成果,能不能受保護、又算誰的。各法域立場不一,這對「你能否主張權利」很關鍵。境外法制僅供參考,在台灣仍以我國著作權法與智財局見解為準。
台灣
- 純由 AI 演算獨立生成、無人類實際創意投入→不受著作權保護。
- 把 AI 當輔助工具、有人類實際創意投入→成果可受保護,權利原則上歸實際創作的人。
- 仍須個案認定人類貢獻的程度。
美國
- 純 AI 生成、缺乏人類實質創作→不受著作權保護。
- Thaler v. Perlmutter:2026/3 最高法院拒審,維持此見解。
香港/英國(共同法)
- 電腦生成著作「可」受保護,只要投入足夠的技巧、勞力或判斷。
- 著作人=「作出必要安排的人」;保護 50 年。比台、美更寬。
換個角度:保護你自己的著作不被 AI 訓練
如果你是作者或老師,想避免自己的論文、講義、作品被 AI 擷取或訓練,可以從這幾個方向著手。
圖片/藝術作品
用 Glaze(防護,讓風格難被模仿)或 Nightshade(反制,把圖變成「毒樣本」干擾訓練),皆為芝加哥大學開發。Glaze ↗ Nightshade ↗
網站/文字
設定 robots.txt 阻擋爬蟲;可參考 ai.robots.txt 的 AI 爬蟲清單,EFF 有操作說明。ai.robots.txt ↗ EFF ↗
出版合約
簽出版合約時,可加入 Author's Guild 的「禁止 AI 訓練」示範條款(2025)。Author's Guild ↗
追蹤授權動向
用 Ithaka S+R 的「Generative AI Licensing Agreement Tracker」查各出版社是否已簽 AI 授權。Ithaka Tracker ↗
資料擁有者如何讓 AI 查到自己的內容、增加曝光度(想深入再點開)
換個角度:如果你或你的機構就是內容擁有者(圖書館、檔案館、出版社、作者),該怎麼讓 AI 找得到、引用得到你的內容?越來越多人直接問 ChatGPT、Perplexity 而不是用搜尋,而 AI 每次回答通常只引用少數幾個來源,你的內容若被漏掉,等於在這個新入口消失。以下幾個方向。(資料庫自家內建的 AI 工具如 Scopus AI、JSTOR,本館另有專頁 → NCCU 圖書館 · 資料庫 AI 功能 ↗。)
讓 AI 爬得到、引用得到(GEO)
- 放行 AI 爬蟲:在 robots.txt 允許 GPTBot、PerplexityBot、ClaudeBot、Google-Extended,這是「保護著作」那段的相反面:想被引用,就得讓它們讀得到。
- 放一份 llms.txt:放在網站根目錄、「給 AI 的網站地圖」,列出你最值得被引用的內容(目前約七成網站還沒有)。
- 內容要「可被擷取」:重點先講、標題用問句、一段一觀念、多用清單與表格、加 FAQ 與每段 TL;DR,讓 AI 好抓、好引。
- 把身分講清楚:用結構化資料(schema),並讓機構/作者實體對得上 Wikipedia/Wikidata,AI 較容易正確歸屬。
把館藏做成「開放資料」(Collections as Data)
- 把館藏整理成開放資料集、API,讓 AI 直接檢索、研究,業界叫「Collections as Data(把館藏當資料開放)」。
- 例子:日本 NDL(全文 AI 檢索+CC BY 開源資料集與 OCR 模型)、哈佛 Institutional Books(3.94 億頁、讓館藏 AI-ready)、HathiTrust 全文特徵資料集、大英圖書館 collections as data、法國 Gallica/荷蘭 KB/挪威國圖/Europeana 的 API、美國國會圖書館 LC Labs、韓國國圖的 AI 訓練資料集。
- 台灣:國家圖書館與政大等機構典藏持續數位化、走開放取用;但整理成「AI 可直接取用的開放資料集」規模仍在起步。
出版社怎麼把內容給 AI 用(商業模式)
模式 A:把內容授權給 AI 公司,拿去「訓練」模型
- 把內容賣給 AI 公司拿去訓練模型,通常是一次性或分期的授權金。
- 學術例子:Taylor & Francis × 微軟(約 US$10M)、Springer Nature × Google(據報約 US$23M)、Wiley(2026 會計年度 AI 授權約 US$49M);Cambridge 改採「作者可選擇加入(opt-in)」。
- OpenAI 是最活躍的買家;其董事長 Bret Taylor 2026 作證時直言,這類授權是「為了避免訴訟」。
- 爭議:多數作者沒被告知、也分不到錢,因此有人主張「乾脆走開放取用」。
模式 B:把內容接進 AI 的「答案引擎」,回答時即時顯示並附上出處
- 你的內容會直接出現在 AI 的回答裡、並附上出處連結,讓使用者當場讀到,這種模式是「即時引用」,不是把內容拿去訓練模型。
- Perplexity 出版商計畫:你的內容每被 AI 引用一次,你就分到一部分廣告或訂閱收入(Comet Plus 方案讓出版社拿八成)。這和 OpenAI「一次付清一筆授權金」不同,這裡是「被用越多次、分越多」。
- Mistral × AFP 也屬這類(明講「不拿去訓練」,只即時引用)。
- Wiley 把它的 STM(科學/技術/醫學)教材接進 Perplexity 的 answer engine。
- 學生和教師可以透過 Perplexity 直接用到學校已購買的 Wiley 內容(護理、商業、工程等領域),回答會附引用、可回溯來源。
- 透過學校訂閱的 Perplexity Enterprise Pro 取用;Wiley 是 Perplexity 的「首個教育夥伴」(2025/5 宣布),試辦學校含 Texas A&M、Texas State 等。
- 對照組:規模較小的出版社談不動個別合約,於是有「集體授權」在發展,例如美國 Copyright Clearance Center(CCC)的 AI 授權方案、英國 CLA。
最新:用 MCP 把資料庫「直接接上」AI
2025 下半年開始出現的新做法。MCP(Model Context Protocol,模型情境協定)是 Anthropic 提出、現在 OpenAI/Google/微軟都支援的開放標準(已交由 Linux Foundation 維護),可以想成「AI 的 USB-C」:讓 ChatGPT、Claude 這類 AI 直接連上出版社的伺服器、即時取用同儕審查過的全文並附引用,比你自己貼 PDF、或叫 AI 上網搜尋都更直接、更可靠。
誰在做、怎麼接
- Wiley 推出「Scholar Gateway/AI Gateway」MCP 伺服器(2025/10,與 Anthropic 合作),可接約 300 萬篇文章,支援 Claude、Perplexity、Mistral。
- Scite.ai MCP(2026/2)接 16 億條「智慧引文」;Statista 也有;平台商 Silverchair 用「Discovery Bridge」讓更多出版社快速上線。
- 怎麼接:出版社架一台「MCP 伺服器」,你在 Claude/ChatGPT 裡把它加成「連接器」,AI 就能直接搜尋、取全文,回答會標出處。
會收費嗎?要注意什麼
- 收費:目前兩種:多數透過機構既有訂閱使用(學校有訂就能接),也有的按使用次數計費(pay-per-event)。整體仍在早期、定價未定型。
- 風險:MCP 伺服器方看得到你的查詢;也有 prompt injection 等資安疑慮;多數仍是 beta。
- 對圖書館的意義:「哪些資料庫有官方 MCP、怎麼授權計費」會變成採購與讀者服務的新題目。
- OA 可以自己串:社群已做出許多 MCP 伺服器,把開放內容直接接進 Claude/ChatGPT,不必透過別人建好的入口,例如 OpenAlex(2.4 億筆以上的開放學術目錄)、paper-search-mcp(一次聯邦 arXiv、PubMed、Unpaywall、CORE、Europe PMC、DOAJ、Zenodo 等數十個 OA 來源)、以及把個人書目庫接上的 Zotero MCP。
- 付費牆接不到:這些只能拿到 OA 全文與開放中繼資料;訂閱牆後的全文(Elsevier、Wiley 等)自架 MCP 進不去,這正是出版社官方 gateway 存在的原因。
- 紅線:能自由接的只有 OA;用任何方式讓 MCP 跨過付費牆、去取得未經授權的全文,正是 Bartz、Elsevier v. Meta 兩案的核心爭議,屬侵權紅線,別碰。
- 「所有圖書館目錄」還沒成形:開放學術目錄(OpenAlex)、個人書目庫(Zotero)已可用;但把每一間圖書館的 OPAC 都聯邦成一個 MCP,仍在個別實驗階段。
- 公共領域史料:最乾淨的應用:沒有付費牆、沒有授權紅線。社群已把 Smithsonian Open Access(約 300 萬件 CC0)、Wikidata 等做成 MCP;DPLA、Europeana、Internet Archive、Wikimedia Commons 等開放來源也都可接。機構官方自建仍在萌芽,被視為最佳做法的是「只開放中繼資料、把人導回原件」,讓 AI 給出可回溯的一手指引,而非把整件史料端給 AI,館方也保有控制權。
名詞小辭典(看到不懂的詞就點開)
- 文字探勘(TDM)
- 讓電腦一次讀大量文獻、自動抓取分析,不是一篇篇人工讀。
- 合理使用(fair use)
- 著作權法允許在特定情況下不經授權而利用他人作品;台灣看四要件、逐案判斷,不保證成立。重要:它要由法院逐案認定、通常是在被指控侵權時才拿來主張,不能當成事先的「許可證」,別因為「這應該算合理使用」就放心去做。
- 重製
- 把作品複製一份(含上傳到伺服器);是不是侵權,另看有沒有授權或合理使用。
- 改作
- 把作品「再創作」成新版本,例如翻譯、改寫;是著作人的專有權利。
- RAG(檢索增強生成)
- AI 先去「找資料」再據以回答,答案通常附出處,比純靠記憶更不容易亂編。
- MCP(模型情境協定)
- 讓 AI 直接「接上」某個資料源的開放標準,像「AI 的 USB-C」。
- opt-out(退出/保留權利)
- 權利人事先聲明「我的作品不給 AI 用」。
- answer engine(答案引擎)
- 像 Perplexity 那種「直接給答案+附出處」的 AI 搜尋。
- 開放取用(OA)/CC 授權
- 作者以較寬鬆的授權公開作品;仍要看是哪一種 CC(NC 禁商用、ND 禁改作)。
- 公共領域
- 著作財產權已消滅、任何人都可自由利用的作品。
完整資料出處
指標案件
各地法規與圖書館開放資料(法律怎麼管 vs 資料怎麼開放給 AI)
台灣法規與見解
出版社與外部 AI 的合作
這是資訊整理,不是法律意見。本頁為推廣教育目的所作的整理,非律師意見,也不對任何特定利用是否合法、是否構成合理使用作出保證或背書;著作權與合理使用均須依個案事實逐案判斷,且此領域變動極快(查核日 2026-08-28)。牽涉 NCCU 正式政策或採購授權,請再與館內、研發處或校方法務確認具體合約,必要時洽詢專業律師。