工具情報 · 2026 年第 32 週
本機巡檢 · 覆蓋過去一週(07-31 ~ 08-07)· Max 訂閱零計費 · 承重項經第二源校驗
🔧 版本更新(可升級)
- mlx-vlm v0.6.9 / v0.6.10(08-03、08-04)— 新增 Kimi K3 支持,並補入 MLX-VLM agent skills;本地環境落後於當前發行線,建議升級。release ✓雙證(releases.atom + PyPI 一手核)
- Surya OCR — 本地環境仍停在較舊的發行線,與當前 0.22.x 存在跨週遺留缺口,建議一併補升。release ✓雙證(PyPI + 本機包管理器)
- Syncthing v2.1.3(08-05)— 2.1
線主要變更:設備與文件夾可在 GUI 中按新的
group屬性分組。release ✓ - GoldenDict-ng v26.8.0(08-05)— 新正式發行版(此前為 26.7 alpha 線)。release ✓
- Ollama v0.32.6(08-05)— Qwen3.5 在 Apple GPU 上提速:MLX 引擎現會自動使用模型的 MTP head 做投機解碼。本機已是該版本,無需動作。release ✓
- MinerU 4.0.0a5(07-30)— 4.0 alpha 線繼續推進,穩定線本週未動;alpha 不建議上生產。release ✓
- sherpa-onnx v1.13.4 / 3x-ui v3.6.0 — 上週已報,本週僅有 dev build 與構建產物,屬噪音。
- pinyin-pro 3.28.2(07-31)— 詞庫多音字修正。release
監看方式修正(延續執行):13 個倉庫的
releases.atom 恆為空,本週一律改核
commits。有實質提交者:MLX
框架本體(62)、sc-voice(24)、eSpeak-NG(17)、Digital Pāli
Dictionary(11)、csl-orig(9,持續按 csl-corrections issue
修訂詞條)、Caddy(6)、yt-dlp(3)、PyGlossary(2)、Tesseract(2)。本週零提交:Qwen3-VL、dots.ocr、byt5-sanskrit-analyzers、Matcha-TTS、Vāgdhenu、SanskritShala、pe-ocr-sanskrit、IndicConformer、parler-tts、mlx-examples、Aksharamukha、DCS、Botok、Demucs、DeepFilterNet、Silero
VAD、ctc-forced-aligner。
☁️ 雲端 AI / API 動態
- 🔴 DeepSeek 預告 API 大幅漲價 — 官方定價頁掛出通知:計劃「近期顯著上調 DeepSeek API 整體價格」,要求開發者「相應規劃用量」,但未公佈新費率、未給生效日。創始人在 X 上稱即使上調 2–10 倍,仍會低於西方前沿模型。這是本週對按量翻譯/校對成本影響最大的一條,建議在生效前重估長期批量作業的排期。 官方定價頁 ✓三源證實(官方定價頁一手 + Perplexity 引 XenoSpectrum/Pandaily + 業界報道)
- DeepSeek 峰谷分時計價連續第四週「已宣告未生效」 — 官方定價頁至今仍只有 cache hit/miss 平價。峰時區間曾定為北京時間 09:00–12:00 與 14:00–18:00,生效日始終未公佈。官方定價頁 ✓Perplexity 證實
- DeepSeek-V4-Flash-0731 開放權重發佈(07-31~08-01,MIT 許可)— 官方生產檢査點,主打 agentic 與編碼能力提升;模型倉庫一手核為 61.8 萬下載、2,643 likes。HF ✓三源證實
- Anthropic — 本週無新基礎模型發佈(Opus 5 係 07-24 已報條目)。
- OpenRouter — 至 08-03 當週下架一個免費端點(poolside/laguna-m.1:free),新增 inclusionai/ling-3.0-flash;目錄現約 1,031 個帶計價的模型。OpenRouter ⚠單源待核
- Google Antigravity 1.1.10(08-03)— 加入 Gemini
Enterprise 登錄、Workforce Identity Federation/ADC 認證支持、只讀
.git沙箱訪問,並修復子代理樹終止與--model/--effort標誌解析。changelog ⚠單源待核(僅讀公開變更日誌與新聞,未調用任何 Google API) - 免費 GPU 平台 — Kaggle 未見 2026 年度配額政策變動公告,維持每週 30 小時量級並按需浮動;Modal、百度 AI Studio 本週無公開政策變動。⚠「未見公告」不等於無變動,屬弱結論
- Azure Document Intelligence — 仍為 v4.0 GA,Read(OCR)模型 $1.50/千頁,本週無新版本或定價調整。
⭐ 更優替代掃描
- 吠陀天城體 OCR:VedOCR — 681
行專家標註的手寫吠陀梵語寫本(Pada-pāṭha 傳統)數據集,附 TrOCR
微調基線,專門針對古體連字與吠陀聲調符號這兩個現用管線的薄弱點;論文獲
ICDAR 2026 DALL Workshop(維也納)接收,稱字符錯誤率降低 26.85
個百分點。GitHub
✓兩源證實(GitHub API 一手核 + Gemini)
- ⚠ 可試不可依賴:倉庫未聲明許可證、星標極少、數據規模僅 681 行;26.85pp 為作者自報且無第三方復現。定位為「值得試跑的補充數據源」,不是替代現用吠陀 OCR 模型的依據。
- +補遺(Gemini 提供):同作者的 MORPHBG(色彩感知二值化管線 + 吠陀梵語 OCR 專家標註數據集)已獲 IEEE ICIP 2026 接收,尚未公開發佈 — 值得下季度持續盯。
- 梵語 OCR/天城體 VLM/梵語·巴利·藏語 TTS/梵語 ASR/梵語 NLP-MT/音源分離·去噪·強制對齊:本週無更優替代(上述各類監看倉庫與模型本週均零更新)。
🖥 本機 AI 模型全景監看
層一·別落後 —
清單內模型本週全部無變化。逐個經模型倉庫 API
一手核,最後修改時間均早於本週窗口:吠陀 TrOCR、梵語 whisper
微調、MITRA、Sanskrit_TTS、Indic
Parler-TTS、Vāgdhenu、Unlimited-OCR、dots.ocr、Gemma
4、Qwen3-VL。推理引擎本體升至 Ollama v0.32.6(見上)。 -
gemma4 圖像輸入支持:本週 Ollama 發行說明未提及 gemma4
vision 相關修復,該問題仍未解決,繼續掛單追蹤。
層二·別停滯 — 本週有三個值得記錄的新視野:
- mlx-audio — Apple MLX 上的統一 TTS/STT/STS 庫,7,688 星、本週仍在日更、PyPI 已到 0.4.7;已接入 Kokoro、Qwen3-TTS、Whisper、Parakeet、Qwen3-ASR、VibeVoice 等。⭐ 意義:現有本機語音棧分散在多個彼此獨立的虛擬環境裏,這是一個現實可行的整合層候選。GitHub ✓GitHub + PyPI 一手核
- Qwen3-ASR(0.6B/1.7B)與 Qwen3-TTS-12Hz(0.6B/1.7B),Apache-2.0 — 模型倉庫 API 一手核確認存在:ASR-0.6B 428 萬下載、TTS-12Hz-0.6B-Base 43 萬下載。體量適合 24GB 統一內存本地跑,且已被 mlx-audio 接入。⚠ 待驗:均非本週新出(年初模型),且無任何梵語專項評測證據 — 列為候選,不構成替代建議。HF
- Audio8-TTS-Preview-0.6b(07-31,Apache-2.0,293 likes)— 本週新出的小體量 TTS 預覽版,尚無梵語或印度語系相關證據,待驗。HF
🏛 IE 文獻學新工具/資源(更廣範圍)
- Learning Diachronic Representations of Ancient Greek Letterforms(arXiv:2606.24984,2026-06-23)— 以古希臘這一延續最久的書寫系統為個案,提出三個歷時表徵學習數據集(含字符級的 Hell-Char),目標是讓表徵在跨越數世紀的書寫變異下保持穩健。對古文書學斷代、以及 HTR 模型的跨時代遷移有直接價值。arXiv ✓arXiv API 一手核
- 本週另掃到的希臘/拉丁 ATR 語義分析管線、AthDGC 希臘語樹庫等條目均已在既往週報記錄,按去重規則不重複收錄。
- 其餘子類(Avestan/古波斯/Fraktur OCR、比較語言學與詞源數據庫、GRETIL/TITUS/DSAL/SARIT/Logeion/DCS 等語料平台)本週無顯著新動態。
📋 清單變動
- 建議補入監看清單:
mlx-audio(本機語音棧潛在整合層)、Qwen3-ASR/Qwen3-TTS 系列(本地小模型候選)、VedOCR(吠陀 OCR 數據集)。 - 監看方式:13 個
releases.atom恆空的倉庫本週已按 commits 核實,該修正此前已記錄但尚未正式寫回規格文件,建議落實。 - 方法坑(本週新增,重要):Perplexity、Gemini、DeepSeek 三家網頁輸入框均會靜默吞掉超長提示(經驗閾値約 400 字符以上),提交後輸入框清空且不報錯。此前記錄將該現象歸因於「中文輸入」,本週以純英文提示復現同一故障,說明眞正的變量是長度而非語種。對策:承重核査問題一律拆成 ≤2 句的短問,分批提問。
🔎 第二源校驗小結
- Perplexity 證實 3 條(DeepSeek 漲價預告、峰谷計價仍未生效、V4-Flash-0731 開放權重);Gemini 證實 1 條(VedOCR)並補遺 1 條(MORPHBG @ IEEE ICIP 2026);存疑 0 條。
- ⚠ 獨立性折扣(須計入):本次 Perplexity 的答案由 Gemini 3.1 Pro Thinking 生成,與 Gemini 面板並非完全獨立的兩源。所幸兩條承重結論(漲價預告、峰谷未生效)另有官方定價頁的一手佐證,故結論仍成立;但本週的「三源證實」實質强度低於標稱。
- DeepSeek 面板未取回:輸入框反覆清空、會話未建立,為連續第二週出現,已按優雅降級略過。
- 🔬 本地模型參考(Gemma,離線·不計入共識):本地推理服務未在運行,本週略過。
- 手動核査清單(建議補査):① Antigravity 1.1.10 的具體變更項;② OpenRouter 本週免費端點的增減明細;③ Kaggle 配額是否有未公開調整;④ VedOCR 所稱 26.85pp 增益的第三方復現情況。