Kakaoは10月8日、言語モデリングの国際学会「COLM 2026」で、大規模Mixture of Experts(MoE)モデルの学習最適化技術と軽量化に関する研究成果を発表した。最適学習率を低コストで推定する手法と、モデルの小型化と性能改善を両立する「BBT」構造を披露した。
COLMは、大規模言語モデル(LLM)と言語モデリングを扱う国際学会で、2024年に新設された。Kakaoはメインカンファレンスに加え、トークナイゼーションのワークショップ「TokShop」でも研究成果を紹介した。
メインカンファレンスでは、大規模MoEモデルにおける最適学習率を、学習コスト全体の約1%で推定する手法を報告した。学習率は、学習時のパラメータ更新幅を左右する重要な指標だ。
同社は、小規模モデルで得た学習設定を大規模モデルへ拡張する「μ-パラメータ化」をMoE構造に合わせて適用した。モデル規模と学習トークン量を段階的に増やしながら最適学習率を探索し、短期間の学習区間で得た設定が大規模学習でも有効かどうかを検証した。
この手法は、Kakaoの「kanana-2.6-155b-a17b」の事前学習にも適用した。同社によると、10兆トークン規模まで安定して学習できたという。
TokShopでは、モデルサイズを抑えながら性能向上を図る「BBT」構造を公開した。従来のByte Pair Encoding(BPE)ベースのモデルが、単語やサブワード単位の情報を保持する方式であるのに対し、BBTはより細かな単位であるバイトを活用しつつ、複数文字をまとめて処理する方式の利点も取り込むよう設計したとしている。
比較実験では、パラメータ数を20.2~40.4%削減し、テスト性能は2.7~6.6%改善した。誤字脱字や文字レベルのノイズへの耐性に加え、学習していない言語への転移性能も向上したという。
Kakaoは、BBTがオンデバイス環境でのメモリ負荷を抑え、多言語入力や誤字脱字の多い対話環境でも安定した性能を発揮する用途に適しているとみている。
今後は、さまざまなモデル構造に加え、マルチモーダルや多言語環境へ適用範囲を広げ、大規模LLMの学習コストをさらに引き下げる方針だ。
Kakaoの関係者は「今回の研究は、AIモデルの性能を維持・向上しながら、学習コストと運用コストを削減できる可能性を示したものだ。今後は多様なモデル構造やマルチモーダル、多言語環境へ研究を拡張し、実サービスでの活用可能性を高めていく」とコメントした。