Zhipu AIは、先週Ox Alphaモデルが実は自社のGLM‑5.3‑Flashであること、OpenRouterとOpenCodeで匿名テストが行われたこと、すべてのトラフィックが中国製AIチップ上で処理されたことを明らかにした。
GLM‑5.3‑FlashはKVキャッシュサイズを約4.4倍、注意計算を3倍削減する。これは線形およびスパース注意機構、密なIndexPool、Sinkhorn‑Knoppアルゴリズムで制御されるManifold‑Constrained Hyper‑Connectionsプロトコルの組み合わせにより実現されている。
モデルは依然としてKimi‑K3やDeepSeek‑V4‑Flashといった競合よりKVキャッシュサイズがやや大きく、改善余地があることを示す。約100兆トークンの日次処理量はHuawei AscendクラスのGPU上で1週間の試験で実現され、30兆トークンのマルチモーダル事前学習データでClaude Opus‑4.8レベルの性能をコストの1割で達成した。
