Zhipu AI, geçen hafta Ox Alpha modelinin aslında kendi GLM‑5.3‑Flash olduğunu ve OpenRouter ile OpenCode’da anonim olarak test edildiğini, tüm trafiğin Çin yapımı AI çipleri üzerinde işlendiğini açıkladı.

GLM‑5.3‑Flash, KV önbellek boyutunu yaklaşık 4.4 kat, dikkat hesaplamasını ise üç kat azaltıyor; bu, lineer ve seyrek dikkat mekanizmalarının, yoğun bir IndexPool’un ve Sinkhorn‑Knopp algoritmasıyla yönlendirilen Manifold‑Constrained Hyper‑Connections protokolünün birleşimi sayesinde mümkün oluyor.

Model hâlâ Kimi‑K3 ve DeepSeek‑V4‑Flash gibi rakiplerin KV önbellek boyutundan biraz daha büyük, bu da iyileştirme alanı olduğunu gösteriyor; yaklaşık 100 trilyon tokenlik günlük iş yükü, Huawei Ascend sınıfı GPU’lar üzerinde bir haftalık deneme sürecinde gerçekleştirildi ve 30 trilyon tokenlik multimodal ön‑eğitim verisiyle Claude Opus‑4.8 seviyesinde performans, maliyetin onda biriyle sağlandı.