人工知能モデルの性能を維持しながら縮小するために用いられる知識転送手法のコストを削減する2つの新技術が開発された。研究者は、教師モデルの上位100トークンを事前に計算してメモリへの保持要件をなくし、Kullback-Leibler(KL)損失関数を分割してメモリ使用量を大幅に削減した。この変更により、単一GPUで長文の処理が可能となり、大規模実験のコストが低減した。

知識転送の最も一般的な手法であるオンライン転送は、教師モデルと学生モデルを同時にメモリ上に保持する必要がある。これにより、各ステップで教師モデルを再計算しなければならず、膨大なメモリが消費される。新手法では、教師モデルの出力を事前に計算して保存し、学生モデルはその保存データで学習する。これにより、教師モデルをメモリに保持する必要がなくなり、メモリ使用量が大幅に減少する。

研究者は、これらの新手法により単一GPUで32K長さのテキスト処理が可能となり、大規模実験のコストが削減されたと指摘している。ただし、これらの手法にもいくつかの制限がある。