工具情報 · 2026 年第 29 週
本機巡檢 · 覆蓋過去一週(07-10 → 07-17)· Max 訂閱零計費 承重項經 Perplexity + Gemini(Pro Extended)+ DeepSeek(Instant + Search)三家 AI 異源互校
🔧 版本更新(可升級)
雙證確認(releases.atom + 本機環境比對均落後,建議升級):
- MinerU 4.0.0a1 / 4.0.0a2 — 首個 4.0 alpha 預發布系列(07-14、07-15):增強 PDF 處理與併發管理、新增重寫過程中跳過損壞頁的能力、ImagePayloadCache 圖像處理。⚠ 屬 pre-release 而非穩定版,生產管線宜先觀望,勿直接上主力。release ✓三源證實
- MinerU 3.4.4(07-10 穩定版)— 增強 PDF 字體分析(新增拉丁與 CJK 字體使用偵測)、加入偏移重複字符偵測以改善文本渲染。這是當前 3.x 線最新穩定版,建議升級。release ✓三源證實
- Surya OCR v0.21.2 — Bump pypdfium2 維護更新;建議升級。release ✓兩源證實
- mlx-vlm v0.6.5 — 新增 deepseek_v3 / deepseek_v32 模型類型、LFM2 移入共享組件模塊並修逐層量化覆蓋、修 MRoPE 解碼位置;建議升級(本地 VLM/OCR 交叉源)。release ✓兩源證實
新版發布(基建/周邊類,本機未直接比對,供留意):
- 3x-ui v3.5.0 — MTProto 多客戶端(mtg-multi 引擎,每客戶端一組 FakeTLS secret)、SQLite→PostgreSQL 遷移、50 萬級規模性能與節點同步強化。release
- llama-cpp-python v0.3.34 — 例行版本,同步發 metal/vulkan/rocm/cuda 等多後端輪子。release
- GoldenDict-ng v26.6.2 — 正式版(此前多為每日 alpha 構建)。release
- ChromaDB 1.5.10.dev — 滾動開發構建,非穩定版。release
本週無新 release:Tesseract、yt-dlp、Syncthing、Caddy、PyGlossary、sherpa-onnx、CosyVoice2、eSpeak-NG、pyannote.audio、python-audio-separator、PySceneDetect、DPD、Botok、CDSL、esbuild、fail2ban 等。
☁️ 雲端 AI / API 動態
- DeepSeek 峰谷分時計價「已宣告、未生效」——前兩週懸案結案 ✓三源一致。官方定價頁至今只列 cache-hit/cache-miss 固定價,全頁無任何時段字樣;OpenRouter 07-13 的第三方定價追蹤同樣列平價,兩處互證。⚠ 重要限定:該機制確由官方於 6/29 預告,擬隨 V4「正式版」於 7 月中旬實施(峰時為北京每日 9–12、14–18,約谷時 2 倍),故屬「已宣告未生效」,不是已取消——7 月中旬已至而未見落地,宜持續盯。官方定價頁
- DeepSeek 舊模型名 07-24 停用 — 維持不變,官方定價頁仍載明;本週無新增停用項。
- Anthropic / Claude — 本週無新模型、上下文或定價變動(官方 release notes 與 news 兩頁互證)。窗口內官方動態均為非模型項(HIPAA 自助配置、記憶系統改版、Cowork 網頁/移動端擴展等),不影響模型路由。
- Gemini 3.5 Pro 仍未發布
⚠本週最有價值的分歧。判定:未發布。官方
DeepMind 模型頁至今明示「3.5 Pro coming soon」;Gemini
網頁版自家模型選單也只有 3.1 Pro/3.5 Flash/3.1
Flash-Lite,並無 3.5 Pro(現場直接觀察)。Perplexity 與
DeepSeek 均判「未發布,『7/17 發布』係未經證實傳聞」。唯 Gemini
自稱「Google 已正式確認
7/17、經企業預覽渠道通報」,但提不出任何可核來源 →
視為孤證幻覺,不採信。DeepMind 官方頁
- +補遺(DeepSeek 提供):彭博社於 07-17 當日報道稱,Gemini 3.5 Pro 因編碼能力未達 Google 內部目標而延期數月(原定 2026-06 發布)。即 7/17 當天媒體報的是「延期」而非「發布」。
- Google Antigravity IDE v2.3.0 ⚠三家各執一詞,標「待核」。Gemini 稱 07-12 發布,含隊列消息與 .txt 附件;DeepSeek 稱版本確實存在但報道日為 07-15,且兩項具體功能無法核實;Perplexity 稱完全查無此版本,疑為不實。官方 changelog 為 JS 渲染 SPA,機讀(WebFetch/defuddle)均回空,無法以主源裁決。結論:v2.3.0 很可能存在(2/3 家+兩個第三方聚合站),但日期(07-12/13/15 三說)與功能細節均未坐實,不宜當定論。
- OpenAI GPT-5.6(Sol/Terra/Luna)07-09 GA,並已上架 OpenRouter — ✓三源一致(OpenAI 官方博客+ OpenRouter 目錄頁標註 Released Jul 9, 2026)。與梵語棧弱相關,僅作模型路由背景記錄。
- OpenRouter — 07-16 品牌改版(新標識/字體/配色,純視覺,無 API 變動);平台費率本週無變動。⚠ Meta Muse Spark 1.1 是否已上架 OpenRouter:目錄頁存在但 Meta 官方博客稱刻意不開放第三方平台,來源互斥、不採信。
- 免費 GPU 平台 — Kaggle(T4/P100 週配額)、Modal(免費 $30/月,不綁卡)、百度 AI Studio(算力卡)本週均無政策變動(各為官方單源,窗口內未見新公告)。
- Azure Document Intelligence — 本週無新 OCR 模型版本或定價變動(官方 What's new 頁最新實質條目仍停在 2026-03)。相鄰產品 Content Understanding 傳「7 月上線同步 Read/Layout API」,窗口內未見證實,不計入。
⭐ 更優替代掃描
- 天城體 VLM OCR:候選 MonkeyOCRv2(arXiv:2607.11562)—— 凍結視覺編碼器+輕量語言模型得到的 0.7B 文檔解析模型,在 MDPBench(17 語言,含天城體/印地語) 創開源 SOTA,超越此前最佳 3B 模型 dots.mocr 絕對 2.8 個百分點,視覺編碼器約小 11 倍;以 1.13 億圖語料 MonkeyDoc v2 聯合預訓練(圖到文+像素級版面重建以保筆畫)。✓三源證實。⚠ 兩處糾正(兩家獨立指出):論文基線名為 dots.mocr 而非 dots.ocr;論文日期為 07-13 非 07-11。⚠ 落地保留:授權僅限學術/非商業;且 Hindi ≠ 梵語全部複雜度(變音符與連字密集場景未專門評測),實測前宜先小樣本核驗。arXiv
- 梵語 ASR:可留意 sushrota-sanskrit-asr(HF,約 07-13 更新)—— 基於 IndicConformer(~129M)的 CTC 頭,專攻梵語誦讀/śāstra 文體,自報 CER 3.6–7.3%。⚠單源待驗:模型卡未提供與現用基線的直接對比,屬小團隊項目,不建議切換,僅記錄觀察。
- 梵語 OCR/版面分析、梵語·巴利·藏語 TTS、梵語 NLP·MT、音源分離·去噪·強制對齊:本週無更優替代。
🏛 IE 文獻學新工具/資源(更廣範圍)
- Stanza 梵語管線(stanza-sa) — Stanford Stanza 工具包新增專門的梵語模型(分詞/詞性/詞形還原/依存句法),加入其約 80 語種家族。相關性:為梵語語料工作提供 Heritage/DCS 生態之外的一個維護中的通用 NLP 骨幹,適合當第二源解析器做互校。HF(2026-06-27)
- Interpres-Parallel-Corpus(IPC) — 1,383 行中世紀拉丁寫本圖像+轉寫+專家翻譯對齊,首個同類資源。相關性:除新 ground-truth 外,其結論有跨語種方法論價值——領域專用 OCR 較通用 VLM 好至 4.3 倍 CER,且簡單管線勝過加 RAG/後校正的複雜管線,可直接指導非拉丁語管線設計(別過度工程化)。arXiv:2607.03836(2026-07-04)
- GlotOCR Bench — 覆蓋 100+ 文字系統的 OCR/VLM 壓測基準(渲染多語文本;CC BY 4.0,含渲染管線)。發現:多數模型能穩妥處理不足 10 種文字,即便前沿模型也難超過 30 種,且表現隨預訓練數據量而非視覺能力。相關性:可作任何 VLM OCR(dots 系、Qwen3-VL 等)上線前的天城體/IE 文字壓測工具。arXiv:2604.12978(2026-04-14)
- Naamah:梵語 NER 合成語料 — 102,942 句合成梵語命名實體語料(DBpedia 實體播種+LLM 生成)+transformer 基線。相關性:首個大規模梵語 NER 訓練資源,對語料/詞典工作中人名·地名·神名·書名的自動標註有用。arXiv:2604.26456(2026-04-29)
- 教會斯拉夫語 OCR +純視覺 stemma 重建 — 10+ OCR 系統(含經典引擎與前沿 LLM)在 18 世紀手寫教會斯拉夫語上的比較:基礎字母 CER 約 2–3%,但變音符持續失敗;並提出無需轉寫、純憑字形聚類/距離矩陣重建寫本譜系的新方法。相關性:變音符失效模式與吠陀/梵語難題同構;純視覺 stemma 方法可移植到任何多鈔本傳統。arXiv:2604.11724(2026-04-13)
📋 清單變動
- 建議新增監看:F5-TTS-THAI(泰語 TTS,用於 YouTube 教程字幕/配音流水線,跑在雲端免費 GPU)——已在用但未列入監看清單,建議補入 TTS 欄。
- WeNet ASR:上月已記錄,狀態不變。
- 監看清單中 12 個對象本次無 GitHub release 條目(多為 HF 模型或無發布慣例的 repo),屬正常而非抓取失敗。
🔎 第二源校驗小結
三家 AI 就 6 個承重項獨立交叉核(全走網頁訂閱會話,零按量):
- ✓三源證實 3 條:GPT-5.6 07-09 GA 並上架 OpenRouter;MonkeyOCRv2 的 MDPBench 基準宣稱;DeepSeek 峰谷計價尚未上線。
- ⚠分歧 2 條:① Gemini 3.5 Pro 是否已發布——Gemini 孤證稱「官方已確認」,經 DeepMind 官方頁(仍寫 coming soon)與其自家模型選單無此檔反證,判未發布;② Antigravity v2.3.0——三家日期各異(07-12/13/15)、Perplexity 稱查無、功能無人能證,主源 SPA 不可機讀,標待核。
- +補遺 2 條:彭博 07-17 報 Gemini 3.5 Pro 因編碼能力未達內部目標而延期;MonkeyOCRv2 基線名(dots.mocr)與論文日期(07-13)獲糾正。
- 1 條由主源裁決、推翻單家誤判:Perplexity 斷言 MinerU 4.0.0 alpha「查無公開證據、疑為臆測或誤記」,經 GitHub API 實證 4.0.0a1(07-14)/4.0.0a2(07-15)確實存在——誤判成因是 GitHub pre-release 不列為 Latest,只看 releases 頁易漏。Gemini 與 DeepSeek 均獨立證實存在。
方法坑(記錄備查):DeepSeek Expert 模式不支持聯網搜索(界面明示「Search is unavailable in Expert Mode」),首次詢問時模型假裝調用 web_search 並自行假設結果,產出不可信。改用 Instant + DeepThink + Search 後方得真實檢索(檢索 75 頁/精讀 7 頁)。後續評審面板應固定 Instant + Search,勿用 Expert 跑需聯網核查的任務。