PaperBrain 論文腦
把讀過的論文,變成能問、會回查、有出處的第二大腦
Vista Cheng|https://www.vista.tw
Vista Cheng(鄭緯筌)
AI 應用講師|內容策略顧問|寫作教練
《經濟日報》與《科技島》專欄作家、前《風傳媒》產品總監、《數位時代》雜誌主編。著作超過 20 本,長期把 AI 串成研究與寫作的工作流,協助大學教師、研究生與專業工作者把素材變成可累積的知識資產。
今天會走完的六段路
-
01
為什麼需要它
摘要解決不了的三件事
-
02
心智模型
指令層與驗證層,兩層缺一不可
-
03
研究卡與出處標記
八個段落、四種標記
-
04
安裝與 Obsidian
三步驟裝好,六個設定配好
-
05
實戰與維護
從一篇 PDF 到一份綜整,加上定期健檢
-
06
誠信邊界
哪些是機械保證,哪些不是
三週後,你只剩下一句「我好像看過」
你讀了一篇論文,當下覺得懂了。三週後同事問起,你打開資料夾,看到 PDF 躺在那裡,檔名是 2405.12345v2.pdf。你不記得它講什麼,也不記得當初為什麼下載。
問題不在你記性差,在於你沒有把閱讀變成可回查的東西。
寫摘要解決不了的三件事
摘要沒有出處
三個月後想引用其中一句,還是得回去翻原文找頁碼。
摘要彼此不相連
第十篇跟第三篇講的是同一件事,但沒有人告訴你。
分不出誰說的
如果摘要是 AI 生的,你無法分辨哪句是論文說的、哪句是模型腦補的。
它不主打快
它主打三件事:可信、可回查、可累積。AI 的角色從「幫你生東西」,改成「幫你整理但不准亂講」。
01
心智模型:兩層架構
兩層架構:誰負責做,誰負責檢查
指令層(skills)
- ✓ 七份 SKILL.md,寫給 AI 看的操作規範
- ✓ 它們才是產品本體
- ✓ 告訴 AI 該怎麼讀、怎麼標出處
- ✓ 可讀、可改、可自己調整
驗證層(程式)
- ✓ 一組零依賴的 Node 程式
- ✓ 機械檢查 AI 的產出
- ✓ AI 說「我標了出處」不算數
- ✓ 程式驗過才算
AI 產出可信,不靠自律,靠機械檢查
再往前一步:能用程式決定性產生的,就不要讓 AI 生。文獻矩陣由程式直接讀卡片產出,模型完全不經手,所以矩陣裡的內容在結構上不可能是捏造的。
資料流:一篇論文會經過什麼
一篇論文
│
├─ capture ─→ 10_Sources/ 原始檔案與全文,查證的權威依據
│ 00_Inbox/ 書目暫存,做成卡片後會被刪掉
│
├─ read ────→ 20_Cards/ 研究卡(核心產物)
│ 這一步會停下來問你
│
├─ link ────→ 30_Concepts/ 原子概念筆記,並建立卡片之間的連結
│
├─ ask ─────→ 只用你的卡回答問題,不寫檔
│
└─ synthesis → 40_Synthesis/ 文獻矩陣、缺口與矛盾
你的 vault 就是一堆純 markdown 檔。沒有資料庫、沒有專有格式、沒有鎖定。
五個資料夾,各有各的職責
-
00_Inbox/
擷取後還沒做成卡的書目暫存。卡片產出後會被刪掉,所以它是選填欄位唯一的備份來源
-
10_Sources/
原始 PDF 與轉檔全文。這是查證的權威依據,永遠不要手動編輯
-
20_Cards/
研究卡,核心產物。你唯一該動手改的是「我的評註」那一欄
-
30_Concepts/
原子概念筆記。它們是 graph 上的樞紐,多篇論文靠它們聚成主題
-
40_Synthesis/
跨卡綜整。同一天同一主題重跑會自動遞增版本,不覆蓋
02
研究卡與出處標記
一張研究卡的八個段落
四個事實區(必須帶出處)
- ✓ 研究問題:這篇在問什麼
- ✓ 方法與族群:怎麼做的、對象是誰
- ✓ 結果:發現了什麼
- ✓ 限制:這篇的限制
四個屬於你的區塊
- ✓ 一句話:全卡的 TL;DR
- ✓ 關鍵概念:抽出來連到概念筆記
- ✓ 與我的連結:呼應、延伸或矛盾
- ✓ 我的評註:AI 不該替你填這欄
一張卡實際長什麼樣
---
citekey: otsuka2024chatgpt
title: "100 天挑戰"
year: 2024
status: read
reviewed: true
sourceStatus: full
---
## 結果
<!-- pb:findings -->
- 完成 100 個 App〔p.5 src〕
## 限制
<!-- pb:limitations -->
- 未報告對照組〔n/a〕
- 作者可能有選擇性回報〔inf〕
標題下一行的 pb 錨點是語言中性的,驗證程式靠它認段落,所以卡片換語言也驗得動。Obsidian 閱讀模式不會顯示它。
四種出處標記,語言中性
無論卡片是中文、英文還是日文都長一樣,因為驗證程式要跨語言用同一把尺
〔p.12 src〕
出自原文第 12 頁。來源有頁碼時用。
〔§3.2 src〕
出自原文某章節。來源沒有頁碼時用,例如 arXiv 的 HTML。
〔inf〕
AI 的推論,不是原文說的。
〔n/a〕
原文沒有提到這件事。
定位符的存在,是為了解除捏造壓力
如果規格硬性要求每條出處都要有頁碼,那麼遇到根本沒有頁碼的 HTML 來源時,就是逼 AI 在「編一個頁碼」與「卡住不動」之間二選一。給它一個誠實的第三條路,它就不必說謊。
與其要求模型不要犯錯,不如把犯錯的動機拿掉。
inf 與 n/a 是這套系統的良心
一個誠實說「這是我推論的」、「論文沒講這件事」的工具,比一個什麼都答得出來的工具有用得多。跑完之後回報會告訴你這張卡有幾條 src、幾條 inf、幾條 n/a。
三個選填欄位,缺了不會擋你,但會咬你
-
sourceStatus
full 或 partial。缺了,日後無從得知這張卡的出處鏈是不是來自不完整的來源
-
doi
缺了,綜整時這篇論文真實的 DOI 會被判成虛構,參考清單永遠生不出來
-
venue
缺了,書目與參考清單就少一塊
-
它們從哪來
由擷取階段寫進 inbox 暫存,再由閱讀階段帶到卡上
-
為什麼要盯
暫存檔在卡片產出後會被刪掉,那是這三欄唯一的備份,刪掉就永久遺失
03
安裝:十分鐘裝好
動手之前,先確認四件事
安裝就三個動作
工具鏈落腳
把解壓出來的資料夾搬到長期位置,例如 ~/Tools/paperbrain。絕對不要留在下載或桌面。
建立你的 vault
跑 paperbrain-init.mjs,帶上 --root、--mode、--language 三個參數。
安裝 skills
把七個 skill 資料夾複製到 ~/.claude/skills/,然後重開 Claude Code。
三個動作的實際指令
# 1. 工具鏈搬到長期位置,之後就別搬
mv ~/Downloads/paperbrain ~/Tools/paperbrain
# 2. 建立 vault(--root 一定要寫,省略會建在當前目錄)
node ~/Tools/paperbrain/bin/paperbrain-init.mjs \
--root ~/PaperBrain \
--mode obsidian \
--language zh-TW
# 3. 安裝 skills,然後重開 Claude Code
cp -r ~/Tools/paperbrain/skills/* ~/.claude/skills/
mode 可選 obsidian 或 plain;language 接受任何 BCP-47 代碼,zh-TW 與 en 是一級支援。init 是冪等的,重跑不會蓋掉你改過的設定。
最大的雷:工具鏈搬家,驗證層就默默失效
skills 被複製到 ~/.claude/skills/ 之後就跟工具鏈分家了,它們靠設定檔裡的 toolchainRoot 才找得回驗證程式。搬了工具鏈,卡片照樣產出,但沒人檢查了。
四個新手常踩的坑
-
工具鏈留在下載資料夾
遲早被你自己清掉,設定檔的絕對路徑跟著失效
-
init 忘了帶 --root
預設值是當前目錄,會把整套骨架建在工具鏈裡面。那些空資料夾直接刪掉即可
-
vault 建在 Obsidian 主庫裡面
不會壞,但全文轉檔會洗掉你原有的搜尋結果。建議獨立一個
-
複製 skills 蓋掉同名資料夾
cp -r 不會問你。裝之前先 ls 一眼 ~/.claude/skills/
-
裝完沒重開 Claude Code
skill 不會被載入,會誤以為安裝失敗
安裝驗收:三個都過才算裝完
在 Claude Code 裡說一句「檢查我的論文腦」,看到健檢報告就代表活了
04
在 Obsidian 搭建 vault
Obsidian 補的是導覽,不是儲存
你的資料本來就是純 markdown,用任何編輯器都打得開。Obsidian 加的是四件事:可以點的雙向連結、反向連結面板、看得見形狀的 graph,以及一個好用的全域搜尋。
所以它是建議搭配,不是必要條件。第 05 段會講不用它怎麼辦。
兩種佈局,先選一個再動手
獨立 vault(第一次用建議這個)
- ✓ PaperBrain 自己一個 vault
- ✓ 搜尋乾淨,graph 只有論文網路
- ✓ 設定只影響 PaperBrain,風險低
- ✓ 適合以研究為主的使用情境
放進既有主庫當子資料夾
- ✓ 研究卡可以連到你自己的想法筆記
- ✓ 同一張 graph,跨領域的關聯看得見
- ✓ 記得把 10_Sources 設為排除的檔案
- ✓ 適合已有成熟 Obsidian 工作流的人
把資料夾開成 vault
先 init,再開 Obsidian
順序反過來不會壞,但你會多一個對齊路徑的步驟。
選 Open folder as vault
在 Obsidian 的 vault 選擇畫面,指到你剛剛 init 出來的資料夾。
讓它建 .obsidian 目錄
那是 Obsidian 自己的設定,與 PaperBrain 無關,不要刪。
照下一頁把六個設定改好
這一步不做,日後最容易出現連結對不上與卡片被外掛改壞。
必改的六個設定(上)
-
新連結格式:最短路徑
設成絕對路徑的話,Obsidian 插入的連結會多出資料夾前綴,跟卡片裡的寫法不一致
-
保持使用 Wikilink
關掉之後會改用另一種連結語法,跟卡片既有的寫法混在一起就亂了
-
自動更新內部連結:可以開
但要知道它的邊界:改檔名時 frontmatter 的 citekey 不會跟著改
-
鐵則:不要手動改卡片檔名
檔名就是 citekey,那是這張卡的身分證。兩邊一分家就會回報命名不一致
必改的六個設定(下)
-
新筆記的預設位置
指到 vault 根目錄或你的草稿夾,不要指到 20_Cards。隨手建的筆記落進去會被當成壞掉的卡
-
附件的預設位置
預設是「與目前檔案相同的資料夾」,代表你讀卡片時貼一張圖,圖就掉進 20_Cards
-
排除的檔案:加入 10_Sources
讓全文轉檔在搜尋結果降權、也不出現在 graph。子資料夾佈局的人這條是必做
-
別動 _schema.md
那是隨產品出貨的格式合約,隨時可以查「這個欄位到底該填什麼」
外掛:直接開,與要先排除卡片資料夾
直接開,只讀不寫
- ✓ 反向連結:看哪些卡引用這個概念
- ✓ 大綱:八個段落一眼跳轉
- ✓ 局部圖表:看單張卡的鄰居
- ✓ Dataview(選用):待複核清單一頁看完
要用的話,先排除卡片與來源資料夾
- ✓ 自動格式化類:會重排 frontmatter 與錨點
- ✓ 自動套模板類:會亂加或蓋掉必填欄位
- ✓ 改顯示標題類:讓檔名與 citekey 分家
- ✓ 判準:任何會自動改寫檔案的外掛
搜尋術:在 Obsidian 裡查你的第二大腦
path:20_Cards "〔inf〕"
→ 這個 vault 裡所有 AI 推論條目,定期掃一次
path:20_Cards "sourceStatus: partial"
→ 出處鏈有缺口的卡,引用前要特別小心
path:20_Cards "reviewed: false"
→ 還沒經你複核的卡,理想狀態是永遠回傳空的
path:30_Concepts
→ 所有概念,用來抓語意重複但字面不同的那幾個
graph 調兩個地方就好看:依資料夾分組上色(卡片一色、概念一色),並在篩選器關掉附件。日常研究看局部圖表比全域 graph 好用。
Obsidian 使用守則五條
-
不要手動改卡片檔名
檔名就是 citekey
-
不要裝會自動改寫 markdown 的外掛
至少要排除卡片與來源資料夾
-
不要編輯 10_Sources 的全文檔
那是查證的依據,改了就不再是原始證據
-
不要改 _schema.md
那是隨產品出貨的格式合約
-
可以放心改的只有三處
卡片的評註段落、概念定義、綜整草稿
不用 Obsidian 也完全可行
obsidian 模式
- ✓ 雙向連結可以點
- ✓ graph 與反向連結面板
- ✓ 全域搜尋介面友善
- ✓ 卡片格式:一模一樣
plain 模式
- ✓ 連結是純文字,看得懂但不能點
- ✓ 導覽靠 _index.md,連結階段會持續更新它
- ✓ 用 grep 查詢,一行搞定
- ✓ 驗證層與機械保證:完全不打折
05
實戰:怎麼用
實戰:從一篇 PDF 到一份綜整
餵進去
一句「餵腦 ~/Downloads/某篇論文.pdf」,會依序跑擷取、閱讀、連結。
在確認閘認真看
重點看三處:事實區的出處標記、有沒有你不同意的詮釋、評註欄留給你自己。
讓它長出連結
第五張卡開始,它會把你三個月前讀的那篇跟今天這篇連起來。
問你自己的卡
只用你 vault 裡的卡片回答,不用模型記憶補完。
綜合整理一個主題
指令說「綜整這個主題:⋯⋯」,產出文獻矩陣、缺口與矛盾三份東西。
人工確認閘:這不是雜訊,這是重點
產出草稿卡之後一定會停下來,把整張卡攤給你看,等你回應才寫檔。AI 不准自己跳過這一關,也不准把「你還沒回應」當成動筆的理由。
理解發生在你確認的那一刻。
確認閘那三分鐘該看什麼
-
看事實區的出處標記
關鍵結論如果標的是 inf,那是 AI 推論不是論文說的,要回原文確認
-
看有沒有你不同意的詮釋
AI 讀出來的「結果」有時會過度簡化。你比它懂你的領域
-
看評註欄是不是空的
那一欄留給你,是整張卡唯一真正屬於你的東西
-
抽驗兩條頁碼
翻開原始 PDF 對兩句。驗證程式驗得了格式,驗不了頁碼真偽
-
三種回應
確認、要它修正,或明講「先存草稿不用複核」
擷取實務:PDF 還是 HTML,會影響出處精度
PDF(要精確引用時優先)
- ✓ 有頁碼,出處標到 p.12
- ✓ 可以直接翻頁查證,精度高
- ✓ 雙欄排版轉檔時局部順序可能亂
- ✓ 緩解方式:保留原始檔,並在來源檔誠實記載
HTML 或網頁版
- ✓ 通常沒有頁碼,出處標到章節
- ✓ 要靠章節找,精度中等
- ✓ 版面單純,不會有雙欄錯亂的問題
- ✓ 系統不會因為沒頁碼就編一個假的
綜合整理(synthesis)到底產出什麼
-
文獻矩陣
每一列是一張卡,每一欄是一個面向:研究問題、方法、結果、限制。一眼看出這批論文在同一個問題上各自說了什麼
-
缺口
矩陣上的空格就是缺口:哪些面向大家都沒做,那可能就是你的題目
-
矛盾
哪兩篇的結果互相打架,會被標出來,而不是被平均掉
-
關鍵設計
矩陣由程式直接讀卡片產生,模型不經手,所以每一格都真的來自某張卡
-
指令怎麼下
說「綜整這個主題:大型語言模型的幻覺量測」,產出會寫進 40_Synthesis/
七個入口,記住第一個就夠
-
餵腦
一篇論文從頭到尾,最常用的一句
-
擷取這篇 / 讀這篇
只收進來,或把收進來的做成卡
-
連結這張卡
把卡片連進既有的概念網路
-
問我的論文:⋯⋯
只用你自己的卡回答
-
綜整這個主題 / 檢查我的論文腦
把多張卡綜合整理成矩陣,以及定期的 vault 體檢
06
健檢與長期維護
第二大腦會隨規模長大而腐化
卡片改名、概念重複、擷取了沒讀完、來源缺了原始檔。一百張卡的時候你還記得哪裡有問題,五百張的時候不會。
說一句「檢查我的論文腦」,程式會決定性地掃一遍,AI 不得改寫報告。
三個嚴重度怎麼看
error:立刻修
卡片驗不過、死連結、來源檔不見了、卡片壞到讀不進來被跳過。這些讓可回查直接破功。
warn:這週處理
孤兒卡、孤兒概念、暫存滯留超過七天、未複核的卡、重複概念候選。
info:知道就好
來源只擷取到部分。不是錯,但引用時要提醒自己出處鏈有缺口。
最常見的五個健檢代碼
-
CARD_NO_SOURCE
卡片找不到對應的來源檔。補跑擷取,或確認來源是不是被搬走了
-
DEAD_LINK
連結指向不存在的卡片或概念。修正連結,或補建那張卡
-
CITEKEY_FILENAME_MISMATCH
檔名與 citekey 不一致。多半是有人在 Obsidian 裡改了檔名
-
STALE_INBOX
暫存滯留超過七天。讀掉它,或承認不會讀然後刪掉
-
UNREVIEWED_CARD
卡片還沒經你複核。打開逐條看過,這正是它存在的意義
建議的節奏:每二十張卡,或每個月
兩者以先到者為準。另外有兩個時機一定要跑:手動改過卡片檔名之後,以及從別的裝置同步 vault 回來之後。這兩件事最容易產生死連結與衝突副本。
07
誠信邊界
哪些是機械保證,哪些不是
程式機械強制(會擋)
- ✓ 每一行事實主張都帶出處標記
- ✓ 引用指向的卡片與概念真的存在
- ✓ 出現的 DOI 真的來自某張卡的書目
- ✓ 文獻矩陣與卡片內容一致
- ✓ 全文來源記錄了身世
程式驗不到,這幾件只能靠你
- ✓ 驗不了頁碼真偽:它不知道第 12 頁有沒有那句話
- ✓ 驗不出詮釋對不對
- ✓ 驗不出那張卡是否真的支持那句話
- ✓ 驗不出回答有沒有偷用模型的背景知識
- ✓ 驗不出你有沒有真的讀
它能保證的是可回查,不是正確
可回查是正確的前提,但不等於正確。每一條你打算寫進論文的引用,回原文確認一次,不管卡片標得多漂亮。
授權,以及觀念從哪裡來
-
Apache License 2.0
拿到的人可自由使用、修改與再散布,包含商業用途,保留授權與著作權聲明即可
-
卡片與概念的組織方式
取法 Zettelkasten(Niklas Luhmann):原子筆記加雙向連結
-
「第二大腦」一詞
沿用 Tiago Forte 在 Building a Second Brain 的說法
-
PaperBrain 自己的貢獻
把學術誠信做成機械可驗證的一層
-
一句話
方法論可以借,可信度必須自己扛
完整教學手冊 v2.0:不確定的時候翻哪裡
-
第 4 章
安裝逐步驟,含可直接貼給 Claude Code 的安裝提示詞
-
第 5 章
Obsidian 完整一章:佈局、六個必改設定、外掛、graph、搜尋、同步備份
-
第 11 章與附錄 D
健檢的跑法,以及 15 個健檢代碼各自怎麼修
-
附錄 E
驗證碼全表:卡片、引用、來源、載入四組錯誤訊息的意思
-
附錄 G
九十分鐘工作坊帶跑路線,給要帶人一起跑的講者與助教
想更進一步?
AI 學術研究與寫作
從文獻到投稿的完整工作流實戰課 solo.tw/courses/ai-academic-writing
researcher.tw
AI 賦能學術研究基地,課程、資源與文章都在這裡
PaperBrain 工具包
Apache 2.0 授權,附完整教學手冊 v2.0,隨課程發給學員
保持聯絡
iamvista@gmail.com|LINE @iamvista
謝謝
Vista Cheng(鄭緯筌)
報名 AI 學術研究與寫作:https://www.solo.tw/courses/ai-academic-writing
關注學術研究基地:https://www.researcher.tw/
把讀過的論文,變成會累積的第二大腦