工具情報 · 2026 年第 26 週
本機巡檢 · 覆蓋過去一週(2026-06-19 → 06-26)· Max 訂閱零計費 · 承重項經 Perplexity + Gemini 第二源校驗 監看 45 個 GitHub repo + 雲端 AI/API + ★替代掃描 + IE 文獻學全景。
🔧 版本更新(可升級)
三項主力工具上游已有新版,建議擇機升級:
- MinerU — 上游已發 3.4.0 系列(版面分析主力),有新版可升。升級前留意配置兼容。release
- Surya OCR — 上游發大版本「Surya OCR 2」(架構升級),建議升級,但升前留意 API 變動。release
- mlx-vlm — 有新版 0.6.3(本地 VLM/OCR 跑批用),建議升級。release
本週新發布、與在用工具相關(按需升級,非必須):
- llama-cpp-python v0.3.31(06-20)— 本地推理/RAG,含 Apple Silicon 預編譯 metal 輪子。release
- pyannote.audio 4.0.5(06-22,評估中)— 說話人分離/VAD,TTS 數據清洗備選。release
- sherpa-onnx asr-models-qnn-2 / -binary-2(06-24)— 高通 QNN ASR 模型資產,與 Apple Silicon 無關,僅留檔。release
基建類(重大版本才報):
- 3X-UI v3.4.0 / v3.4.1(06-23/06-25)— 代理面板,連續兩個小版本,可擇機更新。release
- Syncthing v2.1.2-rc.4(06-26)— 仍在 rc 候選階段,等正式版再升。release
- goldendict-ng 每日 alpha 構建(06-22)— 無正式版,跳過。
其餘約 36 個監看 repo 本週無新 release;多個活躍梵語 NLP/轉寫工具採滾動分支、無 tag/release,本週無版本事件。
☁️ 雲端 AI / API 動態
- OpenRouter — 2026-06-24 上架 OpenAI 圖像生成模型 GPT Image 1 / GPT Image 1 Mini(Images API,支持透明背景與至多 16 張參考圖;GPT Image 1 約 $10/1M tokens)。本月稍早另上 ~20 個模型(Claude Opus 4.8、Gemini 3.5 Flash、MiniMax M3 等,前週已報)。models ✓三源證實(Gemini Pro + 第三方報道)
- Azure Document Intelligence ⚠️ —
三個預覽版接口(
2024-07-31-preview、2024-02-29-preview、2023-10-31-preview)將於 2026-06-30 徹底退役並終止支持,依賴方須遷至正式版 v4.0(2024-11-30 GA)(追蹤 ID ZQQZ-010)。行動項:確認 OCR 管線未在用上述舊預覽 API 版本(v4.0 GA 不受影響);該服務另已整體併入 Foundry Tools(更名)。what's new ✓三源證實(Gemini Pro + 微軟官方公告) - DeepSeek ⚠️ —
deepseek-chat/deepseek-reasoner兩個舊模型名將於 2026-07-24 停用;若有腳本還在用這兩個名稱(非 v4-pro),下月前須改。V4-pro 75% 促銷已於 5-31 結束,現為標準價。本週無新模型、無新調價。docs ✓Gemini 證實本週無新模型 - Anthropic / Claude — Fable 5 / Mythos 5(6-09 發布)仍因美國出口管制叫停、暫停訪問;模型路由維持 Opus 4.8。本週無新模型。news ✓Gemini 證實本週無新模型
- Google Gemini / Antigravity
⚠️(紅線:僅讀公開新聞,未調任何 Google API)— ① Gemini CLI 自
2026-06-18 起停止服務 AI Pro/Ultra 及免費,官方轉向
Antigravity CLI;②
gemini-3.x image preview系列 6-25 下線。依賴 Gemini CLI 入口的零計費第四源工作流須覈查是否受影響。(均前週已報,本週無新增)CLI 轉移公告 - 免費 GPU 平台 — Kaggle(T4/P100 週配額約 30 小時、週六 00:00 UTC 重置)、Modal(Starter 每月 $30 額度)、百度 AI Studio 本週均無公開政策變動。Kaggle/Modal 為單源待核,百度查無公開報道。
⭐ 更優替代掃描
本週新一輪掃描:8 個目標類別均無「本週發布 + 多源交叉 + 可證更優」的新替代(梵語 OCR、天城體 VLM、梵語/巴利/藏語 TTS、梵語 ASR、梵語 NLP/MT、音源分離/去噪/對齊)。仍在觀察的既有候選:
- 天城體 VLM / 密集
OCR:DeepSeek-OCR-2(HF
deepseek-ai/DeepSeek-OCR-2,高壓縮密集文本 OCR,非 Google 系可放心試)、Nanonets-OCR2-3B(Qwen2.5-VL 架構,印度多語/多腳本生產級微調)——均可與現用 dots.ocr/Qwen3-VL 做異源互校。DeepSeek-OCR-2 - 梵語 ASR:Vedavani — 吠陀梵語詩律 ASR 基準語料,可作 whisper-medium-sanskrit 的評測/微調數據。arXiv:2506.00145
- 長期觀察(待驗):Tibetan-TTS(arXiv:2605.02496,2026-05)自稱業界首個大模型藏語 TTS(MOS 4.28–4.35),但僅 arXiv 單源、未見 HF 權重/GitHub 交叉,俟代碼釋出再覈。arXiv
- 旁註留檔:MoScNet(Modi→天城體轉寫 VLM,arXiv:2503.13060),與當前需求不直接相關。
🏛 IE 文獻學新工具/資源(更廣範圍)
本週新增(經 Perplexity 第二源覈實眞實)
本窗口新增量集中在「古典語 VLM OCR 失效診斷 + 結構感知校勘本識別」,多出自同一 HTR 研究組(Clérice / Sagot / Karamolegkou / Angleraud),與梵語 VLM 異源互校制度高度對口:
- Reading or Guessing?(VLM 古希臘 OCR 視覺脫鈎失效) — 證明 VLM 做古希臘校勘本 OCR 時會生成「語法通順但圖上沒有」的眞詞替換、倚賴語言先驗而非看圖;用字級擾動量化,發現專用 OCR 模型 image-gain 極低、近乎不看圖。給出可移植到天城體 VLM OCR 質檢的失效診斷法。arXiv:2605.27750(2026-05-26)✓Perplexity 證實
- Structure-Aware Text Recognition for Ancient Greek Critical Editions — 針對古希臘校勘本(密集 apparatus criticus、旁註、多欄)的結構感知識別,發布 18.5 萬頁 TEI/XML 合成數據 + 眞實掃描基準;微調後 Qwen3-VL-8B 眞實掃描中位 CER 達 1.0%。「TEI/XML 合成頁訓 VLM」可直接挪到梵語批校本 OCR。arXiv:2603.02803(2026-03-02)✓Perplexity 證實
- Samasāmayik — 印地-梵語平行 MT 數據集 — 約 9.2 萬句印地↔︎梵語平行語料,當代語境(教程/兒童雜誌/廣播),CC BY-SA 4.0;補「印地↔︎梵語、當代體」一極,對梵語教學法與現代梵語語料有用。arXiv:2603.24307(2026-03-24)✓Perplexity 證實
- AG-MG — 古希臘→現代希臘平行語料 + MT 基準 — 約 13
萬句對,NMT+LLM 微調基準,附 HF 模型
ilsp/nllb-200-600M-ag-mg-lora;「古→今同語族 MT」方法範本,與文言→白話、梵→現代印地對齊管線同型可借鑒。arXiv:2605.18504(2026-05-18)✓Perplexity 證實
本週另見三條 2-3 月新出、單源待核(未經第二源覈,列作備案):
- VERITAS — 檔案文獻分析模塊化框架(轉寫+版面+語義四階段,文藝復興編年史較商業 OCR WER 相對降 67.6%),與「按版面塊+保留結構語義」流程同構。arXiv:2603.28108(2026-03-30)⚠單源待核
- Operationalizing Document AI(傳統 OCR + LayoutLMv3 + Donut/Nougat + VLM 統一進生產級微服務),對 MinerU→Azure→VLM 流水線服務化有參考。arXiv:2605.18818(2026-05)⚠單源待核
- SumTablets — 蘇美爾楔形文字轉寫數據集(91,606 塊泥板、~697 萬字符 Unicode 楔形↔︎轉寫對,CC BY 4.0);非 IE,但對「古波斯楔形」鄰接資源與「glyph↔︎轉寫配對訓練」方法有參考。arXiv:2602.22200(2026-02-25)⚠單源待核
既有發現(前週已列,續觀察)
- MITRA(正式論文) — 巴利/梵語/佛教漢語/藏語平行語料
+ 多語預訓練模型(MT + 語義檢索),梵→英主力
gemma-2-mitra-it即出自此線。arXiv:2601.06400 - SiPaKosa — 僧伽羅語 + 巴利語三藏綜合語料,對巴利數字化直接有用。arXiv:2603.29221
- DohaScript — 大規模多書手連續手寫天城體數據集,可作天城體 HTR 訓練/評測補充。arXiv:2602.18089
- AnciDev — 古天城體寫本 HTR 數據集(500 頁/3000 行)+ 模型,代碼權重公開,與梵語寫本 OCR 直接對口。ACL · GitHub
- Sandarśana(綜述) — 梵語計算語言學與數字基建全景綜述,適合作工具選型參考底圖。ACM
- 古希臘 HTR 規範化(DHTR25) + 中世紀拉丁 HTR(KBLab) — 更廣 IE(希臘/拉丁)寫本 OCR 的標準化與評測動向。DHTR25 · KBLab
IE 比較語言學/詞源庫方向(LIV、Leiden IEED、計算系統發生學)本輪未檢到 4-6 月眞正的新工具/數據集發布,按「寧缺勿濫」不湊數。
📋 清單變動
- 新增在用工具:WeNet ASR — 本機新增 WeNet
語音識別環境,並有「吳語 ASR」工作目錄,§3 監看清單 ASR
節未列。建議納入監看:
https://github.com/wenet-e2e/wenet/releases.atom,標 ★(中文方言/低資源 ASR 替代掃描)。 - ChromaDB(評估中) — PyPI 包刷新至 1.5.9,去重游標已更新。
🔎 第二源校驗小結
本週自動校驗已執行(專用瀏覽器內已登錄會話,零按量):
- Perplexity(Pro 搜索) — 證實 4 條:IE 文獻學的四篇 arXiv 論文(2605.27750 / 2603.02803 / 2603.24307 / 2605.18504)全部眞實存在,並給出 arxiv.org 引用(作者、標題、日期一致)。此即本週最易被抓取階段編造的條目,已逐一坐實。
- Gemini(Pro 檔) — 證實 3 條雲端:OpenRouter 上架 GPT Image 1/Mini(屬實,$10/1M)、Azure DI 三預覽接口 06-30 退役遷 v4.0 GA(屬實,追蹤 ID ZQQZ-010)、DeepSeek/Anthropic 本週無新模型無調價(與本報告一致)。
- DeepSeek(第三家) — 本次未跑:前兩家已對全部承重項形成「原研究子代理 + 一獨立 panel 源」≥2 獨立核覆蓋,且本輪瀏覽器出現一次瞬時掉線,為週報預算與穩定計從略。
- 結論:證實 7 條(4 IE 論文 + 3 雲端)、存疑 0 條、修正 0 條。承重項全部通過。
本週要點:① 三項主力可升級(MinerU / Surya / mlx-vlm);② 雲端兩條實質新增 —— OpenRouter 上架 GPT Image 1/Mini、Azure DI 三預覽接口 06-30 退役(OCR 管線行動項);另兩條紅線級提醒延續(DeepSeek 舊模型名 7-24 停用、Gemini CLI 已停 AI Pro 入口轉 Antigravity CLI);③ 替代掃描本週無料,藏語 TTS 待驗;④ IE 全景新增 4 條已覈論文(古希臘 VLM OCR 失效診斷 + 結構感知校勘本 + 印地-梵語/古今希臘 MT 語料)+ 3 條單源待核;⑤ 第二源校驗本週眞跑(Perplexity 4 條 + Gemini 3 條,全部證實)。