PaperBrain 論文腦

把讀過的論文,變成能問、會回查、有出處的第二大腦

Vista Cheng(鄭緯筌)

Vista Cheng(鄭緯筌)

AI 應用講師|內容策略顧問|寫作教練

《經濟日報》與《科技島》專欄作家、前《風傳媒》產品總監、《數位時代》雜誌主編。著作超過 20 本,長期把 AI 串成研究與寫作的工作流,協助大學教師、研究生與專業工作者把素材變成可累積的知識資產。

今天會走完的六段路

  1. 01

    為什麼需要它

    摘要解決不了的三件事

  2. 02

    心智模型

    指令層與驗證層,兩層缺一不可

  3. 03

    研究卡與出處標記

    八個段落、四種標記

  4. 04

    安裝與 Obsidian

    三步驟裝好,六個設定配好

  5. 05

    實戰與維護

    從一篇 PDF 到一份綜整,加上定期健檢

  6. 06

    誠信邊界

    哪些是機械保證,哪些不是

🌀

三週後,你只剩下一句「我好像看過」

你讀了一篇論文,當下覺得懂了。三週後同事問起,你打開資料夾,看到 PDF 躺在那裡,檔名是 2405.12345v2.pdf。你不記得它講什麼,也不記得當初為什麼下載。

問題不在你記性差,在於你沒有把閱讀變成可回查的東西。

寫摘要解決不了的三件事

📄

摘要沒有出處

三個月後想引用其中一句,還是得回去翻原文找頁碼。

🔗

摘要彼此不相連

第十篇跟第三篇講的是同一件事,但沒有人告訴你。

🤖

分不出誰說的

如果摘要是 AI 生的,你無法分辨哪句是論文說的、哪句是模型腦補的。

🎯

它不主打快

它主打三件事:可信、可回查、可累積。AI 的角色從「幫你生東西」,改成「幫你整理但不准亂講」。
— 如果你要的是三十分鐘讀完五十篇,這套工具不適合你。

01

心智模型:兩層架構

兩層架構:誰負責做,誰負責檢查

指令層(skills)

  • 七份 SKILL.md,寫給 AI 看的操作規範
  • 它們才是產品本體
  • 告訴 AI 該怎麼讀、怎麼標出處
  • 可讀、可改、可自己調整

驗證層(程式)

  • 一組零依賴的 Node 程式
  • 機械檢查 AI 的產出
  • AI 說「我標了出處」不算數
  • 程式驗過才算
🔩

AI 產出可信,不靠自律,靠機械檢查

再往前一步:能用程式決定性產生的,就不要讓 AI 生。文獻矩陣由程式直接讀卡片產出,模型完全不經手,所以矩陣裡的內容在結構上不可能是捏造的。

資料流:一篇論文會經過什麼

text
一篇論文
   │
   ├─ capture ─→ 10_Sources/  原始檔案與全文,查證的權威依據
   │             00_Inbox/    書目暫存,做成卡片後會被刪掉
   │
   ├─ read ────→ 20_Cards/    研究卡(核心產物)
   │             這一步會停下來問你
   │
   ├─ link ────→ 30_Concepts/ 原子概念筆記,並建立卡片之間的連結
   │
   ├─ ask ─────→ 只用你的卡回答問題,不寫檔
   │
   └─ synthesis → 40_Synthesis/ 文獻矩陣、缺口與矛盾

你的 vault 就是一堆純 markdown 檔。沒有資料庫、沒有專有格式、沒有鎖定。

五個資料夾,各有各的職責

  • 00_Inbox/

    擷取後還沒做成卡的書目暫存。卡片產出後會被刪掉,所以它是選填欄位唯一的備份來源

  • 10_Sources/

    原始 PDF 與轉檔全文。這是查證的權威依據,永遠不要手動編輯

  • 20_Cards/

    研究卡,核心產物。你唯一該動手改的是「我的評註」那一欄

  • 30_Concepts/

    原子概念筆記。它們是 graph 上的樞紐,多篇論文靠它們聚成主題

  • 40_Synthesis/

    跨卡綜整。同一天同一主題重跑會自動遞增版本,不覆蓋

02

研究卡與出處標記

一張研究卡的八個段落

四個事實區(必須帶出處)

  • 研究問題:這篇在問什麼
  • 方法與族群:怎麼做的、對象是誰
  • 結果:發現了什麼
  • 限制:這篇的限制

四個屬於你的區塊

  • 一句話:全卡的 TL;DR
  • 關鍵概念:抽出來連到概念筆記
  • 與我的連結:呼應、延伸或矛盾
  • 我的評註:AI 不該替你填這欄

一張卡實際長什麼樣

markdown
---
citekey: otsuka2024chatgpt
title: "100 天挑戰"
year: 2024
status: read
reviewed: true
sourceStatus: full
---

## 結果
<!-- pb:findings -->
- 完成 100 個 App〔p.5 src〕

## 限制
<!-- pb:limitations -->
- 未報告對照組〔n/a〕
- 作者可能有選擇性回報〔inf〕

標題下一行的 pb 錨點是語言中性的,驗證程式靠它認段落,所以卡片換語言也驗得動。Obsidian 閱讀模式不會顯示它。

四種出處標記,語言中性

無論卡片是中文、英文還是日文都長一樣,因為驗證程式要跨語言用同一把尺

📖

〔p.12 src〕

出自原文第 12 頁。來源有頁碼時用。

📍

〔§3.2 src〕

出自原文某章節。來源沒有頁碼時用,例如 arXiv 的 HTML。

🧠

〔inf〕

AI 的推論,不是原文說的。

🚫

〔n/a〕

原文沒有提到這件事。

🕊️

定位符的存在,是為了解除捏造壓力

如果規格硬性要求每條出處都要有頁碼,那麼遇到根本沒有頁碼的 HTML 來源時,就是逼 AI 在「編一個頁碼」與「卡住不動」之間二選一。給它一個誠實的第三條路,它就不必說謊。

與其要求模型不要犯錯,不如把犯錯的動機拿掉。

💚

inf 與 n/a 是這套系統的良心

一個誠實說「這是我推論的」、「論文沒講這件事」的工具,比一個什麼都答得出來的工具有用得多。跑完之後回報會告訴你這張卡有幾條 src、幾條 inf、幾條 n/a。
— inf 特別多,代表這張卡多是 AI 推論而非原文事實,判讀時要打折。

三個選填欄位,缺了不會擋你,但會咬你

  • sourceStatus

    full 或 partial。缺了,日後無從得知這張卡的出處鏈是不是來自不完整的來源

  • doi

    缺了,綜整時這篇論文真實的 DOI 會被判成虛構,參考清單永遠生不出來

  • venue

    缺了,書目與參考清單就少一塊

  • 它們從哪來

    由擷取階段寫進 inbox 暫存,再由閱讀階段帶到卡上

  • 為什麼要盯

    暫存檔在卡片產出後會被刪掉,那是這三欄唯一的備份,刪掉就永久遺失

03

安裝:十分鐘裝好

動手之前,先確認四件事

Node.js 20 以上 終端機打 node --version。PaperBrain 零依賴,但需要 Node 跑驗證程式
Claude Code 七份 skill 是寫給 AI 看的規範,沒有執行者就跑不起來
一個放筆記的資料夾 有沒有 Obsidian 都可以,等一下第 04 段說明差別
一篇你真的想讀的論文 不要用範例論文練習,用真的,效果差很多

安裝就三個動作

1

工具鏈落腳

把解壓出來的資料夾搬到長期位置,例如 ~/Tools/paperbrain。絕對不要留在下載或桌面。

2

建立你的 vault

跑 paperbrain-init.mjs,帶上 --root、--mode、--language 三個參數。

3

安裝 skills

把七個 skill 資料夾複製到 ~/.claude/skills/,然後重開 Claude Code。

三個動作的實際指令

bash
# 1. 工具鏈搬到長期位置,之後就別搬
mv ~/Downloads/paperbrain ~/Tools/paperbrain

# 2. 建立 vault(--root 一定要寫,省略會建在當前目錄)
node ~/Tools/paperbrain/bin/paperbrain-init.mjs \
  --root ~/PaperBrain \
  --mode obsidian \
  --language zh-TW

# 3. 安裝 skills,然後重開 Claude Code
cp -r ~/Tools/paperbrain/skills/* ~/.claude/skills/

mode 可選 obsidian 或 plain;language 接受任何 BCP-47 代碼,zh-TW 與 en 是一級支援。init 是冪等的,重跑不會蓋掉你改過的設定。

📌

最大的雷:工具鏈搬家,驗證層就默默失效

skills 被複製到 ~/.claude/skills/ 之後就跟工具鏈分家了,它們靠設定檔裡的 toolchainRoot 才找得回驗證程式。搬了工具鏈,卡片照樣產出,但沒人檢查了。
— 所以第一步才要挑一個你不會去動的位置。真要搬,重跑一次 init,或手動改設定檔那一行。

四個新手常踩的坑

  • 工具鏈留在下載資料夾

    遲早被你自己清掉,設定檔的絕對路徑跟著失效

  • init 忘了帶 --root

    預設值是當前目錄,會把整套骨架建在工具鏈裡面。那些空資料夾直接刪掉即可

  • vault 建在 Obsidian 主庫裡面

    不會壞,但全文轉檔會洗掉你原有的搜尋結果。建議獨立一個

  • 複製 skills 蓋掉同名資料夾

    cp -r 不會問你。裝之前先 ls 一眼 ~/.claude/skills/

  • 裝完沒重開 Claude Code

    skill 不會被載入,會誤以為安裝失敗

安裝驗收:三個都過才算裝完

在 Claude Code 裡說一句「檢查我的論文腦」,看到健檢報告就代表活了

工具鏈在固定位置 ls 一下 src/validate-card.mjs 在不在
設定檔指得到工具鏈 打開 paperbrain.config.md 看 toolchainRoot 這一行
skills 裝好且載入 健檢報告出現,說 0 張卡 0 個概念,那是正確結果不是錯誤

04

在 Obsidian 搭建 vault

🧭

Obsidian 補的是導覽,不是儲存

你的資料本來就是純 markdown,用任何編輯器都打得開。Obsidian 加的是四件事:可以點的雙向連結、反向連結面板、看得見形狀的 graph,以及一個好用的全域搜尋。

所以它是建議搭配,不是必要條件。第 05 段會講不用它怎麼辦。

兩種佈局,先選一個再動手

獨立 vault(第一次用建議這個)

  • PaperBrain 自己一個 vault
  • 搜尋乾淨,graph 只有論文網路
  • 設定只影響 PaperBrain,風險低
  • 適合以研究為主的使用情境

放進既有主庫當子資料夾

  • 研究卡可以連到你自己的想法筆記
  • 同一張 graph,跨領域的關聯看得見
  • 記得把 10_Sources 設為排除的檔案
  • 適合已有成熟 Obsidian 工作流的人

把資料夾開成 vault

1

先 init,再開 Obsidian

順序反過來不會壞,但你會多一個對齊路徑的步驟。

2

選 Open folder as vault

在 Obsidian 的 vault 選擇畫面,指到你剛剛 init 出來的資料夾。

3

讓它建 .obsidian 目錄

那是 Obsidian 自己的設定,與 PaperBrain 無關,不要刪。

4

照下一頁把六個設定改好

這一步不做,日後最容易出現連結對不上與卡片被外掛改壞。

必改的六個設定(上)

  • 新連結格式:最短路徑

    設成絕對路徑的話,Obsidian 插入的連結會多出資料夾前綴,跟卡片裡的寫法不一致

  • 保持使用 Wikilink

    關掉之後會改用另一種連結語法,跟卡片既有的寫法混在一起就亂了

  • 自動更新內部連結:可以開

    但要知道它的邊界:改檔名時 frontmatter 的 citekey 不會跟著改

  • 鐵則:不要手動改卡片檔名

    檔名就是 citekey,那是這張卡的身分證。兩邊一分家就會回報命名不一致

必改的六個設定(下)

  • 新筆記的預設位置

    指到 vault 根目錄或你的草稿夾,不要指到 20_Cards。隨手建的筆記落進去會被當成壞掉的卡

  • 附件的預設位置

    預設是「與目前檔案相同的資料夾」,代表你讀卡片時貼一張圖,圖就掉進 20_Cards

  • 排除的檔案:加入 10_Sources

    讓全文轉檔在搜尋結果降權、也不出現在 graph。子資料夾佈局的人這條是必做

  • 別動 _schema.md

    那是隨產品出貨的格式合約,隨時可以查「這個欄位到底該填什麼」

外掛:直接開,與要先排除卡片資料夾

直接開,只讀不寫

  • 反向連結:看哪些卡引用這個概念
  • 大綱:八個段落一眼跳轉
  • 局部圖表:看單張卡的鄰居
  • Dataview(選用):待複核清單一頁看完

要用的話,先排除卡片與來源資料夾

  • 自動格式化類:會重排 frontmatter 與錨點
  • 自動套模板類:會亂加或蓋掉必填欄位
  • 改顯示標題類:讓檔名與 citekey 分家
  • 判準:任何會自動改寫檔案的外掛

搜尋術:在 Obsidian 裡查你的第二大腦

text
path:20_Cards "〔inf〕"
    → 這個 vault 裡所有 AI 推論條目,定期掃一次

path:20_Cards "sourceStatus: partial"
    → 出處鏈有缺口的卡,引用前要特別小心

path:20_Cards "reviewed: false"
    → 還沒經你複核的卡,理想狀態是永遠回傳空的

path:30_Concepts
    → 所有概念,用來抓語意重複但字面不同的那幾個

graph 調兩個地方就好看:依資料夾分組上色(卡片一色、概念一色),並在篩選器關掉附件。日常研究看局部圖表比全域 graph 好用。

Obsidian 使用守則五條

  • 不要手動改卡片檔名

    檔名就是 citekey

  • 不要裝會自動改寫 markdown 的外掛

    至少要排除卡片與來源資料夾

  • 不要編輯 10_Sources 的全文檔

    那是查證的依據,改了就不再是原始證據

  • 不要改 _schema.md

    那是隨產品出貨的格式合約

  • 可以放心改的只有三處

    卡片的評註段落、概念定義、綜整草稿

不用 Obsidian 也完全可行

obsidian 模式

  • 雙向連結可以點
  • graph 與反向連結面板
  • 全域搜尋介面友善
  • 卡片格式:一模一樣

plain 模式

  • 連結是純文字,看得懂但不能點
  • 導覽靠 _index.md,連結階段會持續更新它
  • 用 grep 查詢,一行搞定
  • 驗證層與機械保證:完全不打折

05

實戰:怎麼用

實戰:從一篇 PDF 到一份綜整

1

餵進去

一句「餵腦 ~/Downloads/某篇論文.pdf」,會依序跑擷取、閱讀、連結。

2

在確認閘認真看

重點看三處:事實區的出處標記、有沒有你不同意的詮釋、評註欄留給你自己。

3

讓它長出連結

第五張卡開始,它會把你三個月前讀的那篇跟今天這篇連起來。

4

問你自己的卡

只用你 vault 裡的卡片回答,不用模型記憶補完。

5

綜合整理一個主題

指令說「綜整這個主題:⋯⋯」,產出文獻矩陣、缺口與矛盾三份東西。

人工確認閘:這不是雜訊,這是重點

產出草稿卡之後一定會停下來,把整張卡攤給你看,等你回應才寫檔。AI 不准自己跳過這一關,也不准把「你還沒回應」當成動筆的理由。

理解發生在你確認的那一刻。

確認閘那三分鐘該看什麼

  • 看事實區的出處標記

    關鍵結論如果標的是 inf,那是 AI 推論不是論文說的,要回原文確認

  • 看有沒有你不同意的詮釋

    AI 讀出來的「結果」有時會過度簡化。你比它懂你的領域

  • 看評註欄是不是空的

    那一欄留給你,是整張卡唯一真正屬於你的東西

  • 抽驗兩條頁碼

    翻開原始 PDF 對兩句。驗證程式驗得了格式,驗不了頁碼真偽

  • 三種回應

    確認、要它修正,或明講「先存草稿不用複核」

擷取實務:PDF 還是 HTML,會影響出處精度

PDF(要精確引用時優先)

  • 有頁碼,出處標到 p.12
  • 可以直接翻頁查證,精度高
  • 雙欄排版轉檔時局部順序可能亂
  • 緩解方式:保留原始檔,並在來源檔誠實記載

HTML 或網頁版

  • 通常沒有頁碼,出處標到章節
  • 要靠章節找,精度中等
  • 版面單純,不會有雙欄錯亂的問題
  • 系統不會因為沒頁碼就編一個假的

綜合整理(synthesis)到底產出什麼

  • 文獻矩陣

    每一列是一張卡,每一欄是一個面向:研究問題、方法、結果、限制。一眼看出這批論文在同一個問題上各自說了什麼

  • 缺口

    矩陣上的空格就是缺口:哪些面向大家都沒做,那可能就是你的題目

  • 矛盾

    哪兩篇的結果互相打架,會被標出來,而不是被平均掉

  • 關鍵設計

    矩陣由程式直接讀卡片產生,模型不經手,所以每一格都真的來自某張卡

  • 指令怎麼下

    說「綜整這個主題:大型語言模型的幻覺量測」,產出會寫進 40_Synthesis/

七個入口,記住第一個就夠

  • 餵腦

    一篇論文從頭到尾,最常用的一句

  • 擷取這篇 / 讀這篇

    只收進來,或把收進來的做成卡

  • 連結這張卡

    把卡片連進既有的概念網路

  • 問我的論文:⋯⋯

    只用你自己的卡回答

  • 綜整這個主題 / 檢查我的論文腦

    把多張卡綜合整理成矩陣,以及定期的 vault 體檢

06

健檢與長期維護

🩺

第二大腦會隨規模長大而腐化

卡片改名、概念重複、擷取了沒讀完、來源缺了原始檔。一百張卡的時候你還記得哪裡有問題,五百張的時候不會。

說一句「檢查我的論文腦」,程式會決定性地掃一遍,AI 不得改寫報告。

三個嚴重度怎麼看

🔴

error:立刻修

卡片驗不過、死連結、來源檔不見了、卡片壞到讀不進來被跳過。這些讓可回查直接破功。

🟠

warn:這週處理

孤兒卡、孤兒概念、暫存滯留超過七天、未複核的卡、重複概念候選。

🔵

info:知道就好

來源只擷取到部分。不是錯,但引用時要提醒自己出處鏈有缺口。

最常見的五個健檢代碼

  • CARD_NO_SOURCE

    卡片找不到對應的來源檔。補跑擷取,或確認來源是不是被搬走了

  • DEAD_LINK

    連結指向不存在的卡片或概念。修正連結,或補建那張卡

  • CITEKEY_FILENAME_MISMATCH

    檔名與 citekey 不一致。多半是有人在 Obsidian 裡改了檔名

  • STALE_INBOX

    暫存滯留超過七天。讀掉它,或承認不會讀然後刪掉

  • UNREVIEWED_CARD

    卡片還沒經你複核。打開逐條看過,這正是它存在的意義

🔁

建議的節奏:每二十張卡,或每個月

兩者以先到者為準。另外有兩個時機一定要跑:手動改過卡片檔名之後,以及從別的裝置同步 vault 回來之後。這兩件事最容易產生死連結與衝突副本。
— 零 issue 不等於卡片正確。它只代表可回查的骨架沒斷。

07

誠信邊界

哪些是機械保證,哪些不是

程式機械強制(會擋)

  • 每一行事實主張都帶出處標記
  • 引用指向的卡片與概念真的存在
  • 出現的 DOI 真的來自某張卡的書目
  • 文獻矩陣與卡片內容一致
  • 全文來源記錄了身世

程式驗不到,這幾件只能靠你

  • 驗不了頁碼真偽:它不知道第 12 頁有沒有那句話
  • 驗不出詮釋對不對
  • 驗不出那張卡是否真的支持那句話
  • 驗不出回答有沒有偷用模型的背景知識
  • 驗不出你有沒有真的讀
⚠️

它能保證的是可回查,不是正確

可回查是正確的前提,但不等於正確。每一條你打算寫進論文的引用,回原文確認一次,不管卡片標得多漂亮。

授權,以及觀念從哪裡來

  • Apache License 2.0

    拿到的人可自由使用、修改與再散布,包含商業用途,保留授權與著作權聲明即可

  • 卡片與概念的組織方式

    取法 Zettelkasten(Niklas Luhmann):原子筆記加雙向連結

  • 「第二大腦」一詞

    沿用 Tiago Forte 在 Building a Second Brain 的說法

  • PaperBrain 自己的貢獻

    把學術誠信做成機械可驗證的一層

  • 一句話

    方法論可以借,可信度必須自己扛

完整教學手冊 v2.0:不確定的時候翻哪裡

  • 第 4 章

    安裝逐步驟,含可直接貼給 Claude Code 的安裝提示詞

  • 第 5 章

    Obsidian 完整一章:佈局、六個必改設定、外掛、graph、搜尋、同步備份

  • 第 11 章與附錄 D

    健檢的跑法,以及 15 個健檢代碼各自怎麼修

  • 附錄 E

    驗證碼全表:卡片、引用、來源、載入四組錯誤訊息的意思

  • 附錄 G

    九十分鐘工作坊帶跑路線,給要帶人一起跑的講者與助教

想更進一步?

🎓

AI 學術研究與寫作

從文獻到投稿的完整工作流實戰課 solo.tw/courses/ai-academic-writing

🔬

researcher.tw

AI 賦能學術研究基地,課程、資源與文章都在這裡

📦

PaperBrain 工具包

Apache 2.0 授權,附完整教學手冊 v2.0,隨課程發給學員

✉️

保持聯絡

iamvista@gmail.com|LINE @iamvista

謝謝

Vista Cheng(鄭緯筌)

報名 AI 學術研究與寫作:https://www.solo.tw/courses/ai-academic-writing

關注學術研究基地:https://www.researcher.tw/

把讀過的論文,變成會累積的第二大腦