White Circleは2026年9月21日、学習済みのAIモデルを用途に合わせて調整するためのフレームワーク
Introducing Halo, the best framework for post-training of open-source models.
— White Circle (@whitecircle) September 21, 2026
Halo delivers up to 2.8x the throughput of stock TRL with less peak memory, while models stay in their native HuggingFace format.
Star us on GitHub: https://t. pic.co/ 3mAiUljdrN twitter. com/ NDoydDUBWa
既存モデルを活用し、複数GPUで追加学習
大きなモデルの追加学習では、モデルの重みに加え、学習中の計算結果やパラメーターの更新に使う情報にもメモリが必要になる。1基のGPUに収まらない場合は、複数のGPUに処理を分ける分散学習を使う。ただし、別の学習基盤へ移す際に、モデルの実装や保存形式を合わせる作業が必要になることがある。
Haloは、Hugging Faceの既存モデルに分散学習の機能を加えることで、モデル全体を書き直す手間を抑える。White Circleによると、新しいモデル系列をHaloに対応させるための追加コードは約100行で済むという。学習後の重みもHugging Faceで使われるSafeTensors形式で保存でき、これまでの方法でモデルを読み込める。
モデルや学習手法に応じて、学習データやモデル内部の計算、長い入力列を複数GPUに分散できる。複数の計算部分
単一GPUから複数サーバーまで、各種の学習手法に対応
Haloは、単一GPUでも、NVIDIA B300を搭載した複数サーバーでも利用できる。モデルに少数の学習用パラメーターを追加して調整するLoRAによる追加学習にも対応する。
学習手法として、正解例を与えてモデルを調整する教師ありファインチューニングに加え、外部環境での試行の結果を基に学ぶ強化学習にも対応する。強化学習では、推論エンジンSGLangを主に使って、モデルによるツール利用やコード実行を伴う試行のデータを生成する。そのデータを使った学習と次の試行を並行して進める非同期方式に対応している。
Haloで学習を行う際は、対象モデルや学習手法、GPU構成、学習結果の保存設定をYAML形式の設定ファイルにまとめ、halo launchコマンドで学習を開始する。
処理速度は最大2.8倍、メモリ使用量は構成で変化
White Circleは、NVIDIA B300を8基搭載した環境で、gpt-oss-20bの追加学習時の処理速度を測定した。Haloを使った場合の処理速度は、学習ライブラリTRLを使った場合の最大2.
4,096トークンの入力を各GPUで1件ずつ処理する条件では、TRLのピークメモリ使用量はGPU当たり約48GBだった。これに対してHaloのメモリ使用量は、TRL比で約2.
White Circleは、Liquid AIのモデルLFM2.
GLM-4.7-Flashの追加学習で開発課題の解決率が向上
White CircleはHaloを使い、GLM-4.
学習後のGLM-4.
ソースコードを公開、ライセンスには追加条件
Haloのソースコード、設定例、ドキュメントはGitHubリポジトリで公開されており、Apache License 2.
Haloを、第三者が学習を指示できるサービスとして提供する場合は、そのサービスの売上高に応じて別途商用契約が必要になる。また、Haloで学習したモデルの公開・