GlydによるLLM重みの無損失圧縮技術がGPUメモリを33%削減
25秒でわかる内容解説
16ビットのLLM重みを約11ビットに圧縮する無損失圧縮技術「Glyd」が2026年9月27日に公開された。Open SourceのコードはGPUの行列乗算内部で直接重みを復元し、従来のbf16形式と比較してメモリ使用量を約33%削減する。自作PCやローカル環境で動作する7Bから27Bクラスのモデルを、より少ないVRAMで動かせるため、日本の技術者・愛好家のハードウェア選定基準が変わる可能性がある。
重みの圧縮仕組みと精度維持
GlydはQwenやLlama、Gemmaなどのオープンモデル重みを16ビットから約11ビットに圧縮する。従来のbf16形式(浮動小数点16ビット)では重みの8ビットが指数部に割り当てられるが、訓練済みモデルではその指数部が持つ実質的な情報量は約2.6ビット程度に留まる。Glydは頻出する指数に短い符号を割り当て、稀な値は別リストで管理する。
符号と仮数部はそのまま維持するため、丸め誤差が生じない無損失圧縮となる。GPUは圧縮されたバイト列を読み取り、レジスタ内で復号した直後にテンソルコアへ渡す。この仕組みにより、メモリ上にbf16の複製を生成する必要がない。
19種類のオープンモデルで検証した結果、線形層の行列サイズは31.9%から33.0%の縮小に成功した。圧縮後の精度はbf16とほぼ同等だ。ベンチマークではMMLUの正答率が98.0%から100%で一致し、パープレキシティの差は0.06%以内にとどまった。
4ビット量子化のように重みの値が丸められるわけではなく、データファイルの圧縮に近い性質を持つ。
GPU世代による速度差とメモリ収容力
実際の推論速度はGPUの世代とシーケンス長によって分かれる。RTX 4080 SUPERやA10では1シーケンスあたりの処理時間が25%から28%短縮された。データ転送量が減るため、これらの環境では高速化が期待できる。
一方、A100では1シーケンスで17%高速だが32シーケンスでは6%低速になり、H100では5%高速だが8%低速になる。メモリ収容能力の向上も明確だ。24GBのVRAMを持つGPUにおいて、Gemma 3 12BやPhi-4、R1 Distill Qwen 14Bはbf16では収まりきらないが、Glydに変換すれば単一カードで動作可能になる。
| GPU | 1シーケンス | 32シーケンス |
|---|---|---|
| RTX 4080 SUPER | 25% less time | 28% less time |
| A10 | 28% less time | 18% less time |
| A100 | 17% less time | 6% more time |
| H100 SXM | 5% less time | 8% more time |
Qwen3 8BやLlama 3.1 8B、Mistral 7Bは両形式とも収容できる。
GlydはGPUの種類に応じて最適なレイアウトを自動選択する。RTX 40シリーズでは階層型レイアウトを、それ以外では12ビット形式を採用する。2026年9月26日に公開されたベンチマークでは、A6000やA100、H100 SXMで測定が行われた。BlackwellアーキテクチャのGPUでの計測はまだ実施されていない。写真ではGlydの圧縮前後のメモリ使用量を示す比較図がある。
競合手法との比較と導入方法
2026年9月27日にHacker Newsで公開された際、コメントは寄せられていない。技術的な位置付けとしては、同種の無損失圧縮であるDFloat11やZipServと比較される。DFloat11はNeurIPS 2025で発表され、各ブロックを復号してbf16に変換してから実行する。
ZipServはASPLOS 2026で報告され、Glydのカーネル実行速度とは数%の差しかない。Glydの独自性は、復号プロセスが行列乗算の内部で行われる点にある。これによりメモリ帯域の節約に加え、キャッシュの効率が向上する。
The GPU reads the compressed bytes and decodes them in registers, straight into the tensor cores. No bf16 copy is ever made.
GPUは圧縮されたバイト列を読み取り、レジスタ内で復号した直後にテンソルコアへ渡す。bf16の複製はメモリ上に生成されない。
4ビット量子化(GGUF Q4やAWQ、GPTQ)は重みの値を丸めるためモデルの回答が変化するが、Glydはビット単位で正確な値を再現する。PyTorch(機械学習フレームワーク)のハルネスを用いて、任意のbf16モデルを直接圧縮・検証できる。git cloneでリポジトリをCloneし、gpu/setup_env.shを実行した後にe2e.pyを走らせるだけで、bf16とGlydを並列比較できる。
Pythonパッケージのpip installやvLLM統合も開発中だが、具体的な公開日付は未定だ。
パッケージ公開予定とローカル環境への適用
開発陣は2026年9月27日にロードマップを発表した。まずPyTorchハルネスから始め、Hugging Faceに最適化済みモデルを公開する。その後、pip install "glyd[gpu]"で環境構築し、glyd fitとpackコマンドで重みを圧縮する。
最終的にはvLLM(高速推論サーバー)を経由して推論サーバーとして動作させる予定だ。日本のローカルAI環境では、24GBや48GBのコンシューマーGPUを持つユーザーが多数存在する。Glydの適用により、従来は複数カードやクラウドが必要だった27Bクラスのモデルが、単一GPUで動作するようになる。
Qwen3.8 27BはGlyd使用時で約41GBのVRAMで収まり、48GBカードの下限ラインを大幅に下回る。今後はBlackwell GPUのサポート状況と、vLLM統合の実装速度が注目される。2026年9月27日時点でパッケージ配布の日程は未定だが、オープンソースのハルネスですぐに試験できる状態にある。
出典
- Glyd – Run LLMs in 33% less GPU memory, bit for bit(Hacker News) · 議論