工具情報 · 2026 年第 35 週
本機巡檢 · 覆蓋 08-21 ~ 08-28 · ⚠ 本週三源自動校驗僅一源可用(OpenRouter 額度耗盡,GPT 與 DeepSeek 兩路同時失效),承重項改以「一手源直取 + Gemini 單源覆核」處理 · Perplexity 未執行
🔧 版本更新(可升級)
- mlx-vlm v0.6.16 · v0.6.17(08-24/08-26)— 本機視覺語言模型推理層兩週連發四版,本機落後幅度已相當大,建議升級。release ✓雙證一致(releases.atom + 本機 pip 均確認落後)
- MLX v0.32.2(08-25)— Apple Silicon 機器學習框架本體,有新版,本機落後一個修訂號。release ✓雙證一致
- Surya OCR(無本週新發布)— 本機版本落後主線多個次版本號,屬歷史積壓而非本週新事;因與 OCR 生產線直接相關,單列提醒。release ✓雙證一致(PyPI 版本表 + 本機 pip)
- MinerU(無本週新發布)— 本機仍落後穩定線一個修訂號(上週已報,本週未再發版)。release
- python-audio-separator v0.45.0 · v0.46.0 · v0.47.0(08-26/08-27 三連發)— 音源分離工具,本機未安裝,僅記錄動態。release
- 3x-ui v3.7.0(08-24)— 代理面板,基建側次要版本。release
- 已是最新、無須動作:Tesseract、pandoc、yt-dlp、Ollama(本機已在 0.33.1 GA 線上,0.33.2 目前僅有 rc 預發布)。
- 次要/不建議跟進:Syncthing v2.1.4-rc.2(rc(release
candidate,發布候選))、goldendict-ng 每日構建兩則、chroma 滾動 Latest
標籤、llama.cpp b10656–b10665(每日構建批次)、sherpa-onnx
tauri資產標籤(非版本發布)。 - 本週無新發布:Tesseract、Whisper、CosyVoice、Matcha-TTS、Parler-TTS、Vāgdhenu、Demucs、DeepFilterNet、silero-vad、pyannote.audio、ctc-forced-aligner、EasyOCR、PaddleOCR、dots.ocr、Qwen3-VL、Botok、DPD、CDSL、Aksharamukha、ByT5-Sanskrit、Heritage、DCS、SanskritShala、PySceneDetect、Caddy、fail2ban、esbuild、pinyin-pro、tshet-uinh-js、pyglossary、llama-cpp-python、mlx-audio、mlx-examples 等 44 項。
☁️ 雲端 AI / API 動態
- DeepSeek 發布 deepseek-v4-flash-vision-exp(08-21)— 實驗性多模態模型,純文本能力與 V4-Flash 持平,視覺推理(OCR、圖表分析、截圖解析)大幅提升。已同步上架 OpenRouter,1M 上下文,$0.44/$1.32(每百萬 token 輸入/輸出),約為 V4-Pro 的三分之一價。⭐ 對 OCR 管線有直接評估價値:這是繼 DeepSeek-OCR-2 之後該廠首個「通用多模態 + 廉價」的組合,但尚未經任何天城體/藏文實測,按准入基準應先過 ocr-bench 才談進管線。官方更新日誌|OpenRouter 目錄 ✓兩源證實(官方一手 + OpenRouter API 一手 + Gemini 覆核一致)
- Gemini 3.5 Transcribe 轉正式版(GA)(08-26)—
gemini-3.5-transcribe高精度語音轉文字轉 GA,支持 85+ 語言、說話人分離(speaker diarization)、詞級時間戳,另有串流版gemini-3.5-transcribe-live。⭐ 與 260827 的梵語 ASR 初測直接相關:那次測試用的是預覽版,現已轉正式版,先前「模型隨時可能變動」的顧慮解除,若要正式評估換用主引擎,時機比上週成熟。changelog ✓兩源證實 - Gemini Omni 1.1 Flash 轉 GA(08-27)— 視頻生成/編輯模型,新增視頻續寫(extension)、首尾幀插值(interpolation)、4K 輸出。⚠ 版本號原記為「1.7」係錯誤,正確為 1.1——這是本週唯一一處由覆核糾正的實質錯誤,來源是官方 changelog 頁的摘要環節出錯,經 Gemini 指出後回一手核實確認。與現有工作線關係不大,僅記錄。Google 官方博客 ✓已更正
- 🔴 OpenRouter GPT 三檔位「雙價位」之謎本週結案:另一個價位是
Batch API 端點,不是促銷折扣。 一手 models API
顯示每個檔位各有兩個 id:標準檔與
:batch檔,後者恰為前者半價。標準價現為 terra $2/$12、sol $2/$10、luna $0.20/$1.20;:batch檔各為其一半。連續兩週被誤讀為「降價促銷」的 terra $1/$6,即openai/gpt-5.6-terra:batch。⚠ 另注意 sol 標準價本週讀到 $2/$10,與上週記錄的 $2.5/$15 不符——兩次皆為一手 API 直取,屬眞實差異或上週誤記,方向是下調,暫按本週一手値為準。models API 一手 ⚠分歧已由一手解決:Gemini 回報「本週大幅降價至 terra $1/$6、sol $2/$10、luna $0.10/$0.60」,其中 sol 與一手吻合,terra/luna 兩項係讀到 batch 端點誤判為促銷。 - 🔴 OpenRouter
key_crossverify額度已耗盡(HTTP 402 Payment Required)——本週 GPT 與 DeepSeek 兩路交叉核査因此同時無法執行(兩路共用這一把金鑰,屬單點故障)。金鑰查詢端點顯示週限 $10、已用 $9.24。⚠ 這是本週最需要處理的運維事項:不補額度的話,下週三源校驗仍只剩 Gemini 一路。 - Modal Shared API 分層傳聞:連續第二週未獲一手證實。 官方定價頁本週再次一手核査,全文未出現 "Shared API" 字樣,更無方案分層描述;頁面僅確認 Starter $30/月、Team $100/月免費額度(免費額度未變)。⚠ Gemini 本週判此條「屬實(已證實)」並引官方定價頁為據,但該頁實際並無此內容——引用與內容不符,不採信。原説法仍溯及聚合式二手摘要。官方定價頁一手 ⚠分歧,一手證否
- Azure Document Intelligence:官方頁面本週無任何新動態,且退役日期須更正。 官方 what's-new 頁最新條目仍停在 2026 年 3 月。退役日期以官方頁為準:REST API v2.1 於 2027-09-15 終止支持、v3.0 於 2029-03-30 終止支持。⚠ 廣為流傳的「v2.0 API 與 v2.1 容器 2026-08-31 退役」一説不見於官方 what's-new 頁,容器側日期僅有二手來源支撐,本週不作為已證實事實記錄。此項對本工作線影響有限(Azure 已於 260825 全面退出 OCR 管線,僅存於既有成書的 provenance)。Microsoft Learn 一手 ⚠分歧,一手裁定(Gemini 此條正確)
- Kaggle 免費 GPU 配額:本週未見變動公告。⚠ 沿用上週的誠實標註:「本週無變動」屬難以用公開資料證明的否定命題,只能記為「未見公告」。
- Anthropic:本週無新模型發布(最近一次主要模型發布為 07-24 的 Opus 5);產品側動態為 Claude in Chrome 轉正式開放、MCP 2026-07-28 規範支持擴展,對模型路由無影響。
🆕 新模型雷達(査證/深度研究 + 特別亮眼)
- Qwen3.8-Flash-Next(Qwen,08-24 建庫/08-26 上架)— 約 180B 總參數的 MoE(Mixture of Experts,混合專家)多模態模型,架構為 125B 骨幹 + 51B N-gram 嵌入表,每 token 僅激活約 6B;1M 上下文,OpenRouter $0.15/$0.47。HF 熱度極高(3966 讚)。⚠ 本地不可行(180B 參數遠超 24GB 統一內存),僅為 API 側候選;其「極高稀疏度 MoE」架構方向値得留意。HF 一手核|OpenRouter ✓兩源證實(HF API 參數量一手核 + Gemini 架構描述)
- GLM-5.3-Flash(Z.ai,08-26 上架 OpenRouter)— 320B 總參數/18B 激活的 MoE,1.31M 上下文,$0.075/$0.25(目前掛 50% 折扣)。是本週上架模型中「長上下文 ÷ 單價」最極端的一個,對超長文檔通讀類任務有成本意義。⚠ 同樣不具本地部署可行性。OpenRouter 一手 ✓兩源證實
- Ornith-1.5-35B-A3B /
Ornith-1.5-9B(ornith-ai,08-18 建庫)— MIT
授權,35B MoE 僅激活約 3B,262k 上下文,多模態,強制
<think>推理輸出;9B 版為稠密模型。⭐ 本週唯一對 24GB 本機有實際可行性的新候選:A3B 架構意味着 4-bit 量化後顯存佔用約 20GB、但推理速度接近 3B 模型。⚠ 待驗,不建議直接採用:團隊背景不明(主打「端到端自我改進」,讓模型在強化學習中自行生成訓練任務),Gemini 指出社群實測認為其官方跑分「有過擬合或誇大之嫌」,脫離官方評測框架後表現落差明顯。HF 一手核 ⚠單源+跑分存疑(HF API 證實規格屬實;「跑分誇大」僅 Gemini 一源轉述社群意見,未經獨立測評佐證) - 不收錄:Wan 3.0 Prime、Meta Muse Image(視頻/圖像生成,與本工作線無關);HF 熱榜上大量 Qwen3.8-27B 去限制/量化衍生版(非獨立新模型,且該族已於 260823 從本機清空)。
⭐ 更優替代掃描
- 🔴 梵語 OCR:本週有眞正相關的新成果——arXiv 2608.18696「Impact of Iterative Fine-Tuning on Transcription Accuracy in Complex Historical Sanskrit Manuscripts」(08-19)。提出可在版面層與外觀層迭代微調的傳統 OCR 管線:每處理若干頁就用該書自身的已校正結果回頭微調,使後續頁預測漸準,從而逐頁遞減人工標註量。同時開源三份複雜梵語歷史寫本的 PAGE-XML 格式版面級 + Unicode 標註數據集。⭐ 這是本週最値得跟進的一條:其「人工標註成本隨頁數遞減」正對應 v4.1 管線裡「閂在 GT 不在模型(人工 18-25 小時)」那個眞實瓶頸,且該數據集可直接充實天城體 GT 語料。arXiv ✓一手證實(arXiv API 直取 + Gemini 覆核一致)
- ⭐ 梵語 NLP:arXiv 2608.25038「Padamitra: Grounded Glossary Generation for Classical Sanskrit」(08-25,EMNLP 2026 Findings 接收)。把傳統的padapāṭha 註疏實踐形式化為可評測的 NLP 任務:給定「頌 + 翻譯」,要求模型還原有意義的梵語詞組並產出扎根於譯文的釋義。基準含 31,316 條「頌—翻譯—詞彙表」三元組(取自羅摩衍那與薄伽梵往世書),兩個指標(Jaccard 詞組還原率、Meaning Faithfulness 語義一致性)。結論:指令微調顯著優於提示工程,顯式切分帶來增益;主要失敗模式是 sandhi 與 samāsa 複合詞的過度切分,作者判定形態學建模才是瓶頸。arXiv ✓一手證實
- 🔴 意外收穫(跨所有梵/藏/泰語管線的方法級發現):arXiv
2608.26449「Vowel Signs Are Not Letters: A Pre-tokenization Ceiling on
Multilingual Tokenizer Fertility」(08-26)。指出 HuggingFace
ByteLevel 預分詞器沿用 GPT-2 的詞正則
\p{L}+(一個或多個 Unicode 字母),而婆羅米系文字的元音以組合符號書寫,於是每個詞在每個元音符號處都被切開;由於 BPE 只在預分詞單元內合併,這些切分無論詞表多大、語料多少都無法消除。實測 26 語言中全部 17 種 abugida 受影響,token 膨脹從藏文 1.47 倍到泰文 9.02 倍,而拉丁、西里爾、諺文、漢字均為 1.00 倍。作者把尼泊爾語語料佔比從 5% 掃到 95%:壞分詞器只變動 1.7%,修好的變動 33.9%——證明這是結構性天花板而非數據不足。⭐ 對本工作線的直接含義:凡經 HF 標準分詞器處理的天城體/藏文/泰文文本,token 計數與 API 成本估算都被系統性放大(泰文近九倍),且這一項無法靠「換個更大的模型」解決。arXiv ✓一手證實 | ⚠分歧,一手證否:Gemini 判定「該 arXiv 編號不存在、係幻覺」,但 arXiv API 以 id_list 直査返回唯一條目(第一作者 Sajal Regmi),abs 頁 HTTP 200——屬覆核者的假否定,一手直取勝出。 - 天城體 VLM / 藏文 OCR / 梵語 ASR / 梵語 TTS / 巴利 TTS / 音源分離 / 去噪 / 強制對齊:本週無更優替代。所監看的相關倉庫本週均無新提交或新發布。
- 假陽性排除記錄:HF 上 08-27 出現多個
PP-OCRv6_small/tiny條目,初看像 PaddleOCR 新一代發布;回 PaddlePaddle 官方組織一手核対後確認 PP-OCRv6 實際首發於 2026 年 6 月,08-27 那批是第三方(Immich 相冊項目)的鏡像上傳。不計入本週發現——此即 HFlastModified/建庫日不能當首發日的又一實例。
🖥 本機 AI 模型全景監看
- 層一·別落後:本週無變化。 所監看的模型倉庫(吠陀天城體 OCR、藏文 Tesseract 包、梵英翻譯底模 MITRA、梵語 TTS 兩候選、泰文 TrOCR、印地語 Parler-TTS、Qwen3-VL、PaddleOCR-VL)本週均無新提交,最近一次更新最早的停在 2024 年、最晚的停在 08-08(屬上一窗口)。所屬底模家族本週亦無面向這些專項的新版本。
- 層二·別停滯:本週開拓面有三處——
- 稀疏 MoE 成為新常態,但方向對本機不利:本週三個新模型(Qwen3.8-Flash-Next 180B/6B 激活、GLM-5.3-Flash 320B/18B、Ornith-1.5-35B/3B)全部是極高稀疏度 MoE。這條路線優化的是「單位算力的吞吐」而非「單位顯存的能力」——總參數仍須全部載入顯存。對 24GB 統一內存而言,只有 35B 級以下的 A3B 型有意義(本週唯一符合者即 Ornith-1.5-35B-A3B),180B/320B 兩個再便宜也進不來。這是比單看模型名單更値得記住的判斷。
- 推理框架側:MLX 本體與 mlx-vlm 本週均有更新,Ollama 走完 0.32→0.33 主線切換(0.33.1-rc0 明確標註「MLX: Qwen3.8 Flash Next support」,即 Ollama 的 MLX 後端已跟進本週新架構)。無斷層級進展。
- 語音側:HF 熱榜出現兩個小體量 TTS 新條目——Audio8-TTS-Preview-0.1b(約 1.7 億參數,08-19 建庫)與 Breeze-TTS-2(約 34.7 億參數,08-25 建庫)。⚠ 待驗,僅記錄不推薦:兩者均無梵語/巴利語/藏語支持證據,與現用 Matcha-TTS 自訓梵語引擎不構成可比替代;Audio8 系列上月已有 0.6b 版進入候選清單,本週的 0.1b 是更小的預覽版。
- ⚠ 取源説明:arXiv API 本週可用(上週的 429
限流已恢復),但發現其查詢字段對大小寫敏感——
all:Sanskrit返回零結果、all:sanskrit正常返回。上週「無梵語相關論文」的結論很可能受此影響而偏低,本週已改用小寫重掃,找回三篇直接相關論文。此為工具側坑,已記入狀態文件。
🏛 IE 文獻學新工具/資源(更廣範圍)
- AraMS-28k(arXiv 2608.26921,08-27)— 迄今最大的公開行級歷史阿拉伯文寫本數據集,含頁邊註與插入文字標註。非印歐語,但「行級 + 頁邊註 + 插入文字」這套標註規範正對應梵語寫本(尤其帶註疏的貝葉/紙寫本)的同類難題,方法上可直接借鑑。arXiv
- RefLAM(arXiv 2608.25140,08-25)— 參照物錨定的行標註管線,同屬阿拉伯寫本方向,與上條為同一波成果。arXiv
- 「When Do VLMs Help Arabic Manuscript OCR? A Cross-Dataset Study」(arXiv 2608.22366,08-23)— 跨數據集研究 VLM 在寫本 OCR 上何時眞有幫助、何時不如傳統管線。⭐ 對 v4.1 八格矩陣的「按格准入」原則是同向的獨立證據:VLM 並非普遍更優,須逐格實測。arXiv
- 「Does a Modern-Handwriting Warm-Up Help Historical Arabic OCR?」(arXiv 2608.22316,08-23)— 算力對齊(compute-matched)的可複現評估,檢驗「先用現代手寫體預熱再轉歷史寫本」這一常見做法是否眞有效。方法論上是難得的「對照嚴謹的否證型研究」。arXiv
- Elamite 楔形文字識別(arXiv 2608.18544,08-19)— 零樣本 SAM2 分割 + ViT 識別,處理殘損泥板影像。埃蘭語本身非印歐語系(孤立語言),但古波斯楔形文字與其共存於同批銘文,技術路徑對古伊朗語支材料有間接價値。arXiv
- TEMPLAR Wales(arXiv 2608.26970,08-27)— 威爾士聚落的地理參照環境與地名(toponymic)數據集。凱爾特語支材料,屬印歐比較語言學/地名學的可用開放資源。arXiv
- ⚠ 排除項:Gemini 補遺提出「IIT Madras 於 08-22 左右啓動原生梵語 LLM、數字化 11 萬份稀有寫本」——回一手核実,該項目實為 2026 年 1 月宣布,並非本週新事,係典型的舊聞被當作新動態轉述。項目本身眞實存在(與 Kuppuswami Sastri 研究所合作),但不計入本週。另一條「MITRA/PaliBench 174 萬對平行句庫」亦與已存檔的 MITRA arXiv:2601.06400 重複,不重複收錄。
📋 清單變動
- 🔴 本機 Ollama 模型庫已清空至僅剩一個模型:現只有
huihui_ai/qwen3.5-abliterated:9b(16 小時前更新)。規格中指定用於第 7b2 步「本地模型參考」的gemma4:12b-mlx已不在本機——該路離線觀察源本週因此無法執行。這與「Qwen3.5-9B 單一主力」的本機無審査模型棧定案方向一致,但規格書仍寫着 gemma4,兩者已不同步,建議下週修訂規格或確認是否改以 qwen3.5-abliterated 充當該角色。 - 🔴 OpenRouter
key_crossverify額度耗盡(見雲端節),導致三源校驗的兩源同時失效。建議補額度,或考慮把 GPT/DeepSeek 兩路拆到不同金鑰以消除單點故障。 - 工具清單本身本週無新增在用工具;工作區頂層與筆記庫相關目錄未見規格 §3 未列的新工具。
🔎 第二源校驗小結
- GPT/DeepSeek 兩路本週未執行:OpenRouter
key_crossverify返回 HTTP 402 Payment Required,兩路共用該金鑰故同時失效。按優雅降級原則未反覆重試。 - 校驗結果:證實 5 條、分歧 4 條、補遺 2 條(其中 1 條經核為舊聞,已排除)、一手更正 1 條。
- ⚠ 本週校驗的一個結構性教訓:四條分歧中,三條由「一手源直取」裁定,且其中兩條是覆核者錯而一手對——Gemini 誤判 arXiv 2608.26449「不存在」(假否定,與既有記錄的失效模式一致),並誤判 Modal 分層傳聞「已證實」且所引官方頁實際不含該內容(引用與內容不符)。僅一條(Azure v2.1 退役日期)是覆核者正確、我方原記錄有誤。在單源覆核的週次,一手直取的權重應高於覆核者的判斷,本週各條均按此處理。
- Perplexity:本週未執行(規格允許在承重項可由一手源直接裁定時從略;本週四條分歧已全部由一手源解決,無殘留待査項)。
- 🔬本地模型參考(離線·不計入共識):未執行——規格指定的
gemma4:12b-mlx已不在本機模型庫(見清單變動)。