本 skill 通過統一的命令列指令碼 scripts/scholar-search.py 封裝 arXiv 和 Semantic Scholar API,支援學術論文檢索、詳情拉取、引用網路擴充套件與作者軌跡分析。
requests
pip install requestsS2_API_KEY - Semantic Scholar API 金鑰(必需;優先從程序環境變數讀取)python scripts/set_s2_api_key.py --api-key "<我提供的key>"S2_API_KEY 已存在則覆蓋,不存在則自動追加到 scripts/.env。S2_API_KEY,若未設定則回退讀取 scripts/.env。skills/scholar-search)。scripts/scholar-search.py。scripts/scholar-search.py:主檢索指令碼,執行 arXiv + Semantic Scholar 聯合檢索與結果整理。scripts/set_s2_api_key.py:寫入或覆蓋 .env 中的 S2_API_KEY,用於配置 Semantic Scholar API Key。references/semantic-scholar-api-reference.md:Semantic Scholar API 的端點、引數與欄位參考,用於核對呼叫細節。references/arxiv-api-reference.md:arXiv API 的查詢語法與引數說明,用於核對 arXiv 檢索細節。先提取並標準化以下約束:
輸出語言決策:
功能概述
面向 arXiv 預印本的統一檢索入口,支援關鍵詞/作者/分類/時間過濾、ID 精確拉取、分頁、排序。
典型用途:
核心引數速查(建議優先掌握這6個,覆蓋 95% 場景)
| 引數 | 作用 | 常用值/格式示例 | 必填 | 建議/約束 |
|---|---|---|---|---|
search_query |
查詢表示式(標題/作者/摘要/分類/全欄位) | cat:cs.CL AND all:multimodalau:goodfellow AND ti:gan |
否 | 支援 ti:, au:, abs:, cat:, all: 字首;AND/OR/ANDNOT/短語"" |
id_list |
精確拉取 arXiv ID(逗號分隔,可帶版本 vN) | 0704.0001,cond-mat/0207270v1 |
否 | 與 search_query 可組合做過濾;優先用此拿單篇 |
start |
分頁起點(0-based) | 0, 10, 100 |
否 | 預設 0 |
max_results |
單次返回條數 | 10, 50, 200 |
否 | 預設 10;上限 30000,建議 ≤2000/次 |
sortBy |
排序欄位 | relevance(預設,模糊搜推薦)submittedDate(新論文優先)lastUpdatedDate |
否 | 與最新預印本最常用 |
sortOrder |
排序方向 | descending(新→舊)ascending |
否 | 預設 relevance 時無關 |
時間過濾語法(常用但非必備)
在 search_query 中加:
submittedDate:[YYYYMMDDTTTT TO YYYYMMDDTTTT]
示例:submittedDate:[202501010000 TO 202603082359](2025年1月1日到2026年3月8日)
快速上手案例
# 1. 最新10篇 cs.CL 多模態相關預印本(推薦預設用法)
python scripts/scholar-search.py --source arxiv --params '{"search_query":"cat:cs.CL AND all:multimodal","start":0,"max_results":10,"sortBy":"submittedDate","sortOrder":"descending"}'
# 2. 指定作者 + 近一年論文(時間區間過濾)
python scripts/scholar-search.py --source arxiv --params '{"search_query":"au:goodfellow AND submittedDate:[202503010000 TO 202603082359]","max_results":20}'
# 3. 精確拉取單篇或多篇(最快、最穩定)
python scripts/scholar-search.py --source arxiv --params '{"id_list":"2501.12345,2409.09876v2"}'
# 4. ID 列表 + 額外過濾(例如只看 cs.AI 中的)
python scripts/scholar-search.py --source arxiv --params '{"id_list":"2408.00001,2407.12345","search_query":"cat:cs.AI"}'
高階/注意事項(僅在需要時深入)
references/arxiv-api-reference.md
決策提示sortBy=submittedDate / lastUpdatedDate + descending search_query + sortBy=relevance id_list,速度最快、準確最高 submittedDate:[...] 訪問小蔥技能站7w4.net,解鎖更多實用的AI技能外掛。
高階用法參考:
references/arxiv-api-reference.md
功能概述
面向 Semantic Scholar Academic Graph 的檢索入口,提供論文/作者後設資料、引用網路、引用上下文等。
典型用途:
| 核心引數速查(覆蓋 90% 場景) | 引數 | 作用 | 常用示例/格式 | 必填/約束 |
|---|---|---|---|---|
endpoint |
目標 API 路徑 | paper/search, paper/{paper_id}, citations 等 |
必填 | |
query |
搜尋詞(plain text,無特殊語法) | "machine learning", transformer |
paper/search、match、author/search 必填 | |
fields |
返回欄位白名單(逗號分隔,支援點號巢狀) | paperId,title,abstract,citationCount,openAccessPdf,url,authors |
可選;不傳返回最小資料 | |
limit / offset |
分頁(offset 從 0 開始) | limit:50, offset:0 |
大多端點 limit 預設 100,常見 max 100–1000(見下方關鍵約束) | |
publicationDateOrYear / year |
時間過濾 | 2024:2026, year:2025 |
可選 | |
minCitationCount / venue / fieldsOfStudy / publicationTypes |
過濾高引/特定會議/領域/型別 | minCitationCount:50, venue:NeurIPS |
可選 |
關鍵約束(精簡版)
paper/search:limit <= 100 且 offset + limit < 1000。author/search:limit <= 1000 且 offset + limit < 10000。paper/{id}/references、paper/{id}/citations、author/{id}/papers:limit <= 1000。paper/autocomplete:必須有 query,不要依賴 limit。snippet/search:必須有 query;建議不傳 fields;limit <= 1000;offset 不穩定不建議依賴。references/semantic-scholar-api-reference.md。快速上手案例
# 1. 主題檢索(推薦預設入口,帶關鍵欄位)
python scripts/scholar-search.py --source semantic_scholar --endpoint paper/search --params '{"query":"large language model reasoning","limit":15,"offset":0,"fields":"paperId,title,year,authors,abstract,citationCount,venue,openAccessPdf,url,externalIds"}'
# 2. 標題精確匹配(單條最準)
python scripts/scholar-search.py --source semantic_scholar --endpoint paper/search/match --params '{"query":"Attention Is All You Need","fields":"paperId,title,authors,year,abstract,url,venue"}'
# 3. 論文詳情(已知任意 ID)
python scripts/scholar-search.py --source semantic_scholar --endpoint paper/arXiv:2312.17485 --params '{"fields":"title,abstract,authors,citationCount,openAccessPdf,url"}'
# 4. 引用擴充套件(看誰引用了這篇)
python scripts/scholar-search.py --source semantic_scholar --endpoint paper/PMID:12345678/citations --params '{"limit":20,"offset":0,"fields":"citingPaper.paperId,citingPaper.title,citingPaper.year,citingPaper.citationCount"}'
# 5. 作者軌跡(某作者所有論文,按時間過濾)
python scripts/scholar-search.py --source semantic_scholar --endpoint author/1741101/papers --params '{"limit":30,"offset":0,"publicationDateOrYear":"2023:2026","fields":"title,year,venue,citationCount"}'
滿足任一條件時,繼續檢索 1 輪:
< 3)結束檢索條件:
補充策略:先在同一資料來源內改寫查詢重試 1 次;仍不足再切到另一源補充 1 次。
基於 query 與論文標題/摘要/TL;DR 的語義匹配程度分層:
排序優先順序:
必須停止並輸出結果的條件(任一滿足即終止):
每篇論文必須按以下結構輸出,缺一項即判失敗。
每篇開頭必須是獨立一行(前後空一行):-----------
標題必須是一級標題:# {序號}. **論文完整標題**
若有 TL;DR,標題下一行輸出:TL;DR: {文本} — 來自 {來源};無則整行刪除。
後設資料固定三行、固定順序、欄位名必須加粗: 論文資訊: 來源:{venue/journal/arXiv} | 發表/更新日期:{日期} | 引用數:{數字或未知} | 影響力引用:{數字或未知} | 開放獲取:是/否/未知
連結:Semantic Scholar | PDF:PDF
(無 PDF 時刪除 | **PDF**... 整項,不得寫"無/未知")
作者行:**作者**(前3位 + et al.):{A, B, C et al.}
領域行:**領域**:{領域1, 領域2}(無則整行刪除)
必須包含:
### 研究內容(1–2句,僅基於 abstract/tldr/summary,禁止推斷)
### 摘要關鍵點(2–4條;若不足2條,補"原始資訊有限。")
可選欄位只能放在: 可選額外資訊:
----------- 開始。
-----------
# 1. **Hierarchical Token Pruning for Efficient Vision-Language Reasoning**
TL;DR: 通過分層裁剪視覺與文本 token,在保持精度的同時顯著降低推理開銷 — 來自 Semantic TL;DR
**論文資訊**:
**來源**:arXiv | **發表/更新日期**:2026-01-09 | **引用數**:未知 | **影響力引用**:未知 | **開放獲取**:是
**連結**:[Semantic Scholar](https://www.semanticscholar.org/paper/Hierarchical-Token-Pruning-Example/abcdef123456) | **PDF**:[PDF](https://arxiv.org/pdf/2601.00999)
**作者**(前3位 + et al.):Mina Park, David Lin, Q. Herrera et al.
**領域**:Computer Science, Vision-Language Models
### 研究內容
該研究提出分層 token pruning 框架,在不同網路深度動態移除低貢獻 token。實驗顯示該方法在多項視覺問答與檢索任務上實現更優的效率-效能折中。
### 摘要關鍵點
- 設計了跨層一致性的 token 重要性評分機制。
- 在多個基準上顯著減少 FLOPs 與延遲,同時維持接近基線的準確率。
- 提供消融實驗,驗證不同裁剪率與層級策略的影響。
error 欄位(含 HTTP 狀態碼、錯誤資訊、已嘗試引數)limit 後重試。quota 或 rate limit -> 直接告知我的配額已用盡,建議稍後重試或切換 arXiv。year>=2024、conference only),必須優先編碼到引數中再發起請求這個學術搜尋工具質量較好,能同時搜尋arXiv和Semantic Scholar兩大論文庫,文件詳細示例豐富,容易上手。優點是輸出格式規範、錯誤處理完善、檢索策略清晰。缺點是依賴外部API金鑰且安全性一般,文件有時不完整。如需搜尋學術論文,它是個不錯的選擇。