工具情報 · 2026 年第 31 週
本機巡檢 · 覆蓋 2026-07-24 ~ 07-31 · Max 訂閱零計費 · 承重項經第二源校驗 本週特點:兩條「一手源推翻 AI 面板」的裁決,與一條足以推翻舊結論的本地 OCR 進展。
🔧 版本更新(可升級)
- MinerU 4.0.0a4 / 4.0.0a5 — 4.0 alpha 線本週連發兩版,穩定線最新仍是 3.4.4;本機版落後於穩定線,建議升級(暫不建議上 alpha)。a4 · a5 ✓雙證(release feed + 本機包管理器)
- mlx-vlm v0.6.8(07-27)— 新增 PLaMo 2.1 VL、llm-jp-4-vl 支持與 FLUX.2 圖像編輯量化;本機落後一個小版本,建議升級。release ✓雙證
- Surya OCR — 本機版落後多個大版本,中間跨越了「Surya OCR 2」換代與兩輪版面模型重寫(Fast Layout Model / 版面修復);建議排期評估升級。v0.22.1 ✓雙證
- Tesseract 5.5.3(07-24)— 維護版(錯字、缺失閉合標籤等修復);本機已是最新,無需動作。release
- Ollama v0.32.4 / v0.32.5(07-25 / 07-27)— 加 Laguna 的 Apple GPU(MLX 引擎)支持;修 MLX Metal 上 NVFP4 模型輸出質量下降的 bug;修 Qwen3 MoE 在專家量化不一致時的解碼問題,並打包 gate/up 投影提速(官方稱 M5 Max 約 4–9%)。v0.32.5
- sherpa-onnx v1.13.4(07-30)— 導出 Parakeet CTC 模型、修 Dart iOS 包發布。release
- Syncthing v2.1.3-rc.2(07-28)— 2.1 線 rc。2.1
主要新增:GUI 可按
group屬性分組設備與文件夾、支持帶 CONNECT 的 HTTP(S) 代理(此前只支持 SOCKS)、可按文件夾關閉塊索引(以庫體積換傳輸增量)、GUI 登錄會話時長可配置。release - 3x-ui v3.6.0(07-30)— Overview 重做為「指揮台」式面板(四塊要害指標+72 採樣點迷你圖、吞吐與連接數雙圖、側欄改自動收起圖標欄);隨帶 xray-core v26.7.28,XMC finalmask 破壞性變更已端到端吸收(保存時即拒絕不完整掩碼並點名缺失字段,生成配置時只丟棄出問題那一行,一行壞配置不再拖垮全部 inbound)。release
- Digital Pāḷi Dictionary 2026-07-28 版 — 例行數據更新。release
- llama.cpp — 一週逾十個 build(b10186–b10199),屬常規高頻節奏,未見針對本機管線的單條顯著改動。releases
- Chroma dev 構建 1.5.10.dev235(07-29)。
本週無新版:Caddy、fail2ban、yt-dlp、PySceneDetect、esbuild、pinyin-pro、tshet-uinh-js、PyGlossary、goldendict-ng(僅日構建)、MLX 核心、transformers、faster-whisper、Whisper、CosyVoice、eSpeak-NG、Demucs、DeepFilterNet、Silero VAD、pyannote.audio、llama-cpp-python、Botok、python-audio-separator、ctc-forced-aligner、Indic-TTS、SC-Voice、PaddleOCR。
⚠ 監看盲區(建議修正):本週有約十二個受監看倉庫的
releases.atom返回空條目——IndicConformerASR、SanskritShala、DCS(OliverHellwig/sanskrit)、Qwen3-VL、pe-ocr-sanskrit、byt5-sanskrit-analyzers、parler-tts、mlx-examples、dots.ocr、csl-orig、aksharamukha-python、indic_transliteration_py。這些項目根本不打 GitHub release,靠 release feed 監看等於長期盲視,應改監看 commits 或 tags。
☁️ 雲端 AI / API 動態
- Anthropic — Claude Opus 5 發布(07-24):1M
上下文、128K 輸出。目錄價 $5/$25 每 M token,Fast 檔 $10/$50。OpenRouter 目錄
✓一手源證實(模型目錄 API
created=2026-07-24與定價字段直接核)+媒體報道 - Claude Code v2.1.219(07-24):跟進把 Opus 5 設為默認 Opus 檔並接入 Fast 模式;新增沙箱網絡嚴格白名單開關(非白名單主機直接拒絕,不再逐次詢問);子代理嵌套深度上限由 1 級擴到 3 級。官方 changelog (一手源,未另找第二源)
- OpenRouter 新上架(一手源=模型目錄 API):
- DeepSeek — 峰谷分時計價截至 7 月底仍未生效:官方定價頁只有 cache hit / cache miss 兩檔;v4-pro 與 v4-flash 的目錄價本週亦無變動。官方定價 ✓三源一致(官方頁 + 兩家面板 + 第三方目錄價一手核)。此條已連續三週「已宣告未生效」,屬懸而未落而非取消。
- Google — Antigravity CLI 在 07-18 至 07-28
連發五版(v1.1.4 → v1.1.8),新增現場調推理力度、固定 model
slug、以 Markdown+YAML frontmatter 定義自定義
agent、
--output-format json/stream-json結構化輸出等。GitHub releases ⚠兩家面板説法互斥且均與一手源不符,本節按 GitHub API 一手記(詳見校驗小結)。 - Google — Gemini 3.5 Pro 仍未發布:7 月只出了 3.6 Flash / 3.5 Flash-Lite / 3.5 Flash Cyber 三款,與上週持平。
- Azure — Content Understanding 的 GA 分歧結案:正式
GA 實為 2025 年 11 月 Ignite(API 版本 2025-11-01),不是 2026
年;本月無新 OCR 模型或定價變動。官方
GA 公告 ✓兩源證實(前兩週標「待核」的 GA 狀態就此結案)
- +補遺單源待核:有説法稱 2026-07-15 退役了兩個 preview API(2024-12-01 / 2025-05-01)並關閉 Foundry (Classic) 舊版體驗,依賴預覽版接口者須強制遷移。僅一家面板提及,官方頁未複核到。
- 免費 GPU 三家本月無政策變動:Kaggle 的 GPU 週配額、Modal 的免費額度結構、百度 AI Studio 的算力卡政策均未見公開變更。✓兩源一致
⭐ 更優替代掃描
- 天城體 / 多語 VLM OCR — 本週最有操作價値的一條:Unlimited-OCR 的 MLX 移植集中出現。 基座模型(權重約 6.8 GB,07-29 更新,下載量已達約 260 萬)本週被社群大量移植到 Apple MLX:4bit 約 2.6 GB、8bit 約 4.0 GB、bf16 約 6.7 GB,另有 mxfp8 與 GGUF 版本,全部輕鬆進得了 24 GB 統一內存。 為什麼値得回頭看:此前對該模型「暫不採用」的理由之一是需要 NVIDIA GPU——這條理由本週失效。建議重新評估它在天城體/密集文檔上的表現,與現行 VLM OCR 做一輪異源互校。 基座 · mxfp8 · bf16-mlx · 4bit ✓存在性、體積、日期均經模型倉庫 API 逐個一手核實
- 梵語 TTS — Vāgdhenu(IISc,2026-06-28 開源,Apache-2.0,435★):梵語誦經(pārāyaṇa)TTS。骨幹為 IndicF5 / F5-TTS 的流匹配 DiT(約 337M 參數,無原生時長/音高頭),聲碼器為在 F5 vocos-mel 上微調的 BigVGAN-v2。模型卡自報專家 MOS 約 4.6、連字(含 ṣṭ、ḍḍh 等捲舌送氣連字)100% 正確渲染,並已用於產出 32 部《摩訶婆羅多義釋》影片與 16,017 節《薄伽梵往世書》音頻。 ⚠ 重要更正:模型卡明寫 「No Vedic svaras」——只做古典梵語誦經,不支持吠陀重音,切勿當作吠陀誦讀方案。 技術上還有一處値得記下:它把梵語繞道卡納達文字送入模型(走天城體會觸發印地語 schwa 刪除),這個取捨對任何做梵語 TTS 的人都有參考價値。 GitHub · 模型權重 ✓多源證實,「無吠陀重音」一節經模型卡一手證實
- 強制對齊(章節級 → 句級這個痛點)—
兩個候選,均無梵語驗證,標待驗:
- MFA 3.0(arXiv:2606.18466,06-16)— Montreal Forced Aligner 自 2016 年以來最大改版,英/日/韓四個基準平均邊界誤差 <15 ms;未見南亞語言測試。arXiv
- 任意 ASR 模型的梯度式對齊(arXiv:2607.06831,07-07)— 免訓練、不改模型結構,直接用可微分 ASR 模型的梯度算詞邊界,CTC/transducer/attention/speech-LLM 四種架構共 16 個模型上多數接近或優於模型自帶對齊。理論上可直接套在現用的梵語 whisper 微調模型上,不必等專門的梵語聲學模型;但測試語料只有英語 TIMIT/Buckeye。就「章節級→句級對齊」而言這條路線最貼合既有資產,値得小規模試跑再判斷。arXiv
- 梵語 OCR、梵語 ASR、梵語 NLP/MT、音源分離、去噪:本週無更優替代。 (梵語 NLP 側僅見 arXiv:2606.24172《A Pāṇinian Foundation for Indic Language Processing》,是提案性框架論文、無性能數字,只作留意,不構成候選。)
🖥 本機 AI 模型全景監看
層一 · 別落後
- Ollama 的
gemma4看不了圖:本週有實質進展,但還沒修好。 PR #17487「mlx: add Gemma4 vision support」於 2026-07-31 00:54 UTC 開出,狀態 open、未合併,PR 自述是「臨時的多模態接線方案」,待 MLX runner 管線與 KV cache 穩定後還要重寫;原始 issue #17065(07-07 開)仍 open。上游 mlx-vlm 側的 Gemma4 支持 issue 已於 07-23 關閉,但那是該庫自己的支持,不等於 Ollama 已接上。PR #17487 ✓GitHub API 一手核。繼續等,下週再看。 - 清單其餘模型本週均無官方更新:Qwen3-VL 官方系列、Gemma 4 e4b(07-20,窗口外一天)、Qwen2-Audio-7B、Qwen3.6、Whisper 全系與梵語/印地語微調款、PaddleOCR-VL(06-27)、PP-DocLayoutV3(07-08)、CosyVoice2(05-31)、MITRA。社群衍生版(解限版、GGUF 量化)持續有小動作,非官方權重更新。
- 路徑變更提醒:dots.ocr / dots.mocr
的模型倉庫組織已從
rednote-hilab遷至dots-studio,舊路徑靠 307 重定向暫時仍可用但不保證長期有效;下次重拉權重時改用新組織名。 - 兩個「老化」信號:MITRA 底模已近兩年未更新,Qwen2-Audio 停在 2025-01。若翻譯或音頻管線重度依賴這兩者,宜排期做一輪換代評估——不急,但別忘。
層二 · 別停滯
- Unlimited-OCR 的 MLX 生態(見「更優替代」節)——本週最實用的一條,也正是層二該抓的那種「清單上根本沒有這條路」的新可能性。
- 三元(ternary / BitNet)量化本週在兩頭同時冒頭:
ai4bharat/indic-parler-tts— 語言標籤明確包含梵語(sa),現有清單裏沒有這一項,本週重回 text-to-speech trending。本身不是新品,但既然帶梵語標籤,値得排一次試跑對比。link- Thinking Machines
Inkling-Small(07-27 建庫,權重約 532 GB,圖文音三模態 MoE)— 業界事件,遠超 24 GB 機器範圍,僅作視野記錄;mlx-vlm v0.6.7 已加入支持,説明社群已開始適配。link - MLX 核心本週無新 release(最新仍是 07-07 的 v0.32.0);mlx-vlm 則連發兩版,框架側活躍度很高。
🏛 IE 文獻學新工具/資源(更廣範圍)
- Palaeographicum(2026-05-18)— 維爾茨堡大學+美因茨科學文學院+多特蒙德工業大學合作的 AI 輔助楔形文字書寫風格比對系統,收約 7 萬張照片、逾 500 萬個楔形符號,可識別個別書吏的筆跡特徵,把原本數天的人工比對縮到幾分鐘。對赫梯、阿卡德等楔形文獻學有直接意義。報道 待驗——機構背書可信,但報道未給量化準確率,也未見開源代碼或數據集入口。
- Paraphrasis 平台 + TSDAE/CSE 無監督句向量法(arXiv:2607.24542,07-27)— 針對拉丁語/古希臘語教父文獻(奧古斯丁、耶柔米、亞他那修等)的聖經引用重用偵測與段落檢索。只需 4000–8000 句同領域生語料、筆記本 GPU 數十秒訓練即可勝過基線,且對 OCR 轉錄噪聲有遷移能力。對佛典/梵語文獻的「引文溯源」場景有直接方法論參考價値。arXiv 單源待驗(工具剛發布,未見第三方使用回饋)。
- 本輪未見新動靜:GRETIL / TITUS / DSAL / SARIT / Logeion / DCS 無新版或新功能公告;Leiden IEED 詞源辭典系列本期無新數據庫或 API。
📋 清單變動
- 建議補入監看:
ai4bharat/indic-parler-tts(帶梵語標籤的 TTS)、Unlimited-OCR 基座及其 MLX 移植(天城體 VLM OCR 候選)、prathoshap/vagdhenu(梵語誦經 TTS)。 - 建議修正監看方式:約十二個倉庫從不打 GitHub
release,
releases.atom監看形同盲視,應改監看 commits 或 tags(名單見「版本更新」節末)。 - 路徑變更:dots.ocr / dots.mocr 的模型倉庫組織
rednote-hilab→dots-studio。
🔎 第二源校驗小結
本週承重項 12 條。Perplexity 與 Gemini 兩家跑通;DeepSeek 會話已建立但頁面始終未渲染出回答,本週未取回,自動校驗按兩家計。另有多條改用一手 API 直接核實,未交面板表決。
- ✓兩源以上證實(4 條):DeepSeek 無峰谷分時計價(含官方定價頁);Azure Content Understanding 的 GA 為 2025-11 Ignite;免費 GPU 三家本月無政策變動;Vāgdhenu 的開發機構、架構與授權。
- ⚠分歧(均由一手源裁決)(2 條):
- Antigravity CLI 的版本節奏 — 一家稱「止於 v1.1.5(07-21)」,另一家稱「v1.1.4 到 07-29 才發」,兩家互斥且都與一手源不符。GitHub releases API 顯示:v1.1.4 (07-18)、v1.1.5 (07-21)、v1.1.6 (07-24)、v1.1.7 (07-26)、v1.1.8 (07-28)。教訓復現:AI 面板在「具體版本號與日期」上的可靠性依舊最差,凡能直接査 API 的,一律不交面板表決。
- Claude Opus 5 的日期與定價 — 面板未覆蓋,改用模型目錄 API 一手核(created 2026-07-24;$5/$25,Fast $10/$50;1M 上下文)。
- +補遺(3 條):
- 兩家獨立指出 Vāgdhenu 不支持吠陀重音,經模型卡「No Vedic svaras」一手證實——直接修正了初稿把它寫成「吠陀誦經 TTS」的錯誤。這是本週校驗最有價値的一次攔截:一個聽起來完全合理、且與本圈需求高度契合的説法,恰恰是錯的。
- Azure 於 2026-07-15 退役兩個 preview API 並關閉 Foundry (Classic) 舊版體驗——單源,待核。
- 一家指向「Unlimited-OCR 的 Apple Silicon 移植」,方向正確但細節不可採信:其給出的具體倉庫名與作者名經模型倉庫 API 査證均不存在,實際情況是多個獨立移植同時出現。方向可用、名字要自己核——這正是「聯網模型讀錯具體格式/名稱」的既知失效模式。
- 🔬本地模型參考(Gemma,離線·不計入共識):對五條承重項一律答「不確定」,並自述因事涉 2026 年而無法核實。本週未出現「憑常識一致否定眞事實」這一既知失效模式,屬理想的離線行為——拒答而非編造。累積口碑記一次正分。