Tencent AI Lab の研究者は、現在の大規模言語モデルの速度制限を打ち破ることを目的とした新しい AI フレームワークを発表しました。
今週オンラインで公開された論文で詳しく説明されているこのシステムは、CALM (Continuous Autoregressive Language Models) と呼ばれています。これは、今日のほとんどの生成 AI を強化する低速のトークンごとのプロセスに直接挑戦します。
CALM は、単語の小さな部分を一度に 1 つずつ予測するのではなく、テキストの塊全体を表す単一のベクトルを予測する方法を学習します。この方法により、AI の生成がはるかに高速かつ効率的になり、モデルのスケーリングに新たな道が開かれる可能性があります。
最新の LLM の根本的な弱点は、自己回帰的なトークンごとの生成に依存していることです。この逐次的な依存関係が、AI の速度とスケーラビリティを制限する唯一の最大のボトルネックです。
長い記事を生成するには、何千もの連続した予測ステップが必要となり、プロセスの計算コストが高くつき、時間がかかります。これは単に学問的な問題ではありません。強力なモデルの使用にはコストがかかり、リアルタイムで長い形式の生成が依然として課題であるのはこのためです。
この効率性の問題は、AI 開発者にとって中心的な戦場となっています。 Google Research が以前に述べたように、「これらのモデルをより多くのユーザーに導入する中で、品質を犠牲にすることなくモデルをより速く、より安価にすることが重要な課題です。」
業界は、Google の投機的カスケードから新しい圧縮技術に至るまで、数多くのソリューションを模索してきました。今回、テンセントの取り組みは、より抜本的な解決策を提案している。
この論文は、新しいクラスの超効率的な言語モデルと、トークンによって引き起こされる速度のボトルネックに対する青写真を提案しています。
目標は、予測単位を単一の情報量の少ないトークンから、より豊富なものに根本的に変更することです。
新しいパラダイム: トークンの代わりにベクトルを予測する
生成 AI の現状に対する直接的な挑戦として、CALM は予測タスクを完全に再構築します。研究者らは、LLM の新しいスケーリング軸を提案しています。
「このボトルネックを克服するには、LLM スケーリングの新しい設計軸、つまり各生成ステップのセマンティック帯域幅を増やすことが必要であると私たちは主張します」と彼らは論文に書いています。
この「セマンティック帯域幅」を増やすことにより、モデルは 1 つのステップでより多くの情報を処理できるようになります。 CALM は、離散的ではなく連続的な空間で動作する革新的な 2 段階のプロセスを通じてこれを実現します。
CALM の設計の中心となるのは、高忠実度のオートエンコーダーです。このコンポーネントは、K 個のトークンの塊 (たとえば、4 つのトークン) を単一の高密度の連続ベクトルに圧縮することを学習します。
重要なのは、このベクトルから元のトークンを 99.9% 以上の精度で再構築できることです。次に、別の言語モデルがこの新しいベクトル空間で自己回帰予測を実行します。
によると、プロジェクトの公式ドキュメント「CALM は、一度に 1 つの個別のトークンを予測するのではなく、K 個のトークンの塊全体を表す単一の連続ベクトルを予測することを学習します。」
これにより、生成ステップの数が K 分の 1 に削減され、効率が大幅に向上します。
可能性のないツールキット: CALM が成功を学習し測定する方法
離散トークンから連続ベクトルに移行すると、大きな課題が生じます。モデルでは、標準のソフトマックス層を使用して、考えられるすべての結果にわたる明示的な確率分布を計算できなくなります。
そのため、尤度の計算に依存する従来のトレーニングおよび評価方法は適用できなくなります。これを解決するために、Tencent チームは包括的で可能性のないフレームワークを開発しました。
CALM は、トレーニングのためにエネルギーベースのトレーニング方法を採用しています。これは、厳密に適切なスコアリング ルールを使用して、確率を計算する必要なくモデルをガイドします。
評価のために、研究者らは BrierLM と呼ばれる新しい指標を導入しました。 BrierLM は、困惑度などの従来の指標から離れて、確率的予測ツールである Brier スコアから派生しています。
これにより、予測が現実とどの程度一致しているかをチェックすることで、モデルの機能を公平にサンプルベースで比較できます。これは、可能性が手に負えないモデルに最適な方法です。
AI スケーリングと効率化競争の新たな軸
この新しいアーキテクチャの実際的な影響は、優れたパフォーマンスとコンピューティングのトレードオフです。
推奨読書:
CALM モデルは、強力なベースラインと比較して、トレーニングの計算要件を 44%、推論を 33% 削減します。これは、各ステップのセマンティック帯域幅のスケーリングが、計算効率を向上させるための強力な新しい手段であることを示しています。
この研究により、CALM は、より速く、より安価で、よりアクセスしやすい AI を構築するための業界全体の競争における重要な競争相手として位置付けられます。
Google は、投機的カスケードや入れ子学習などの手法を使用して、AI の速度の問題に取り組んできました。 Inception などの他のスタートアップ企業は、拡散ベースの LLM など、まったく異なるアーキテクチャを模索しています。「マーキュリーコーダー」自己回帰の「構造的ボトルネック」を回避するため。
これらのさまざまなアプローチを総合すると、AI 開発の変化が浮き彫りになります。業界は、純粋に規模を重視することから、よりスマートで経済的に実行可能な人工知能のより持続可能な追求へと移行しつつあります。 CALM のベクトルベースのアプローチは、その面で前進する新しい道を提供します。















