CloudflareはKimiやGLMなどの大規模モデルのGPUメモリ使用を最適化するため、3つの新技術を開発した。KVキャッシュ圧縮、モデル重み圧縮、KVキャッシュ整合性保持がそれらである。これらの最適化は、より多くの顧客を低コストでサポートするために行われ、モデルの正確性には影響しない。

KVキャッシュ圧縮は16ビット精度から8ビット浮動小数点数(FP8、e4m3)に移行することでメモリ使用量を半減させる。これによりKimi K2.6モデルでは約686,000トークンから1,370,000トークンまでのコンテキスト保持能力が向上する。モデル重み圧縮はGLM 5.2で8ビット浮動小数点数から4ビット整数(INT4)に移行することでモデルサイズを705GBから421GBに削減し、GPUメモリ使用量も減少させる。

これらの技術は、同じGPUメモリ上でより多くのリクエストを共有することで効率性を向上させる。KVキャッシュ整合性チェックはメモリページが正しく使用されていることを確認するためのレイヤーを追加する。このチェックはパフォーマンスに最小限の影響しか与えないが、セキュリティを向上させる。