研究者らは、コンピュータ利用エージェントを訓練するために、10の深い領域と2つの能力に焦点を当てた環境からなる合計12の合成世界を開発した。90億パラメータのモデルがこれらの環境全てで訓練された際、基本スコアが36.5%から67.1%に向上し、最新の大規模言語モデルに近づいた。

実験は、環境の深さが重要であることを示した。浅い模擬環境ではモデルのパフォーマンスが低下したが、行動的に現実的で状況一貫性のある環境はモデルの能力を向上させた。歴史的セレクタやネストされたフィルタなど、難しいUIコンポーネントに焦点を当てた特殊な環境は、モデルが以前見たことのないバリエーションも管理できるようにした。

このアプローチは、実際のクローズドシステム(メール、銀行など)で大規模な訓練ができないため、状態を安全にリセットでき、実際のデータベースの変更を反映する合成世界の必要性に基づいている。研究チームは、4つの環境をコード、データ、検証ツールと共にコミュニティと共有し、今後の研究の基盤を築くことを目指している。