· ローカルAI

GlydによるLLM重みの無損失圧縮技術がGPUメモリを33%削減

25秒でわかる内容解説

16ビットのLLM重みを約11ビットに圧縮する無損失圧縮技術「Glyd」が2026年9月27日に公開された。Open SourceのコードはGPUの行列乗算内部で直接重みを復元し、従来のbf16形式と比較してメモリ使用量を約33%削減する。自作PCやローカル環境で動作する7Bから27Bクラスのモデルを、より少ないVRAMで動かせるため、日本の技術者・愛好家のハードウェア選定基準が変わる可能性がある。

重みの圧縮仕組みと精度維持

GlydはQwenやLlama、Gemmaなどのオープンモデル重みを16ビットから約11ビットに圧縮する。従来のbf16形式(浮動小数点16ビット)では重みの8ビットが指数部に割り当てられるが、訓練済みモデルではその指数部が持つ実質的な情報量は約2.6ビット程度に留まる。Glydは頻出する指数に短い符号を割り当て、稀な値は別リストで管理する。

符号と仮数部はそのまま維持するため、丸め誤差が生じない無損失圧縮となる。GPUは圧縮されたバイト列を読み取り、レジスタ内で復号した直後にテンソルコアへ渡す。この仕組みにより、メモリ上にbf16の複製を生成する必要がない。

19種類のオープンモデルで検証した結果、線形層の行列サイズは31.9%から33.0%の縮小に成功した。圧縮後の精度はbf16とほぼ同等だ。ベンチマークではMMLUの正答率が98.0%から100%で一致し、パープレキシティの差は0.06%以内にとどまった。

4ビット量子化のように重みの値が丸められるわけではなく、データファイルの圧縮に近い性質を持つ。

GPU世代による速度差とメモリ収容力

実際の推論速度はGPUの世代とシーケンス長によって分かれる。RTX 4080 SUPERやA10では1シーケンスあたりの処理時間が25%から28%短縮された。データ転送量が減るため、これらの環境では高速化が期待できる。

一方、A100では1シーケンスで17%高速だが32シーケンスでは6%低速になり、H100では5%高速だが8%低速になる。メモリ収容能力の向上も明確だ。24GBのVRAMを持つGPUにおいて、Gemma 3 12BやPhi-4、R1 Distill Qwen 14Bはbf16では収まりきらないが、Glydに変換すれば単一カードで動作可能になる。

GPU世代別推論速度比較(Qwen2.5-7B)
GPU1シーケンス32シーケンス
RTX 4080 SUPER25% less time28% less time
A1028% less time18% less time
A10017% less time6% more time
H100 SXM5% less time8% more time

Qwen3 8BやLlama 3.1 8B、Mistral 7Bは両形式とも収容できる。

GlydはGPUの種類に応じて最適なレイアウトを自動選択する。RTX 40シリーズでは階層型レイアウトを、それ以外では12ビット形式を採用する。2026年9月26日に公開されたベンチマークでは、A6000やA100、H100 SXMで測定が行われた。BlackwellアーキテクチャのGPUでの計測はまだ実施されていない。写真ではGlydの圧縮前後のメモリ使用量を示す比較図がある。

Glydの圧縮前後のメモリ使用量を示す比較図
Glydの圧縮前後のメモリ使用量を示す比較図(出典:Hacker News)

競合手法との比較と導入方法

2026年9月27日にHacker Newsで公開された際、コメントは寄せられていない。技術的な位置付けとしては、同種の無損失圧縮であるDFloat11やZipServと比較される。DFloat11はNeurIPS 2025で発表され、各ブロックを復号してbf16に変換してから実行する。

ZipServはASPLOS 2026で報告され、Glydのカーネル実行速度とは数%の差しかない。Glydの独自性は、復号プロセスが行列乗算の内部で行われる点にある。これによりメモリ帯域の節約に加え、キャッシュの効率が向上する。

The GPU reads the compressed bytes and decodes them in registers, straight into the tensor cores. No bf16 copy is ever made.

GPUは圧縮されたバイト列を読み取り、レジスタ内で復号した直後にテンソルコアへ渡す。bf16の複製はメモリ上に生成されない。

4ビット量子化(GGUF Q4やAWQ、GPTQ)は重みの値を丸めるためモデルの回答が変化するが、Glydはビット単位で正確な値を再現する。PyTorch(機械学習フレームワーク)のハルネスを用いて、任意のbf16モデルを直接圧縮・検証できる。git cloneでリポジトリをCloneし、gpu/setup_env.shを実行した後にe2e.pyを走らせるだけで、bf16とGlydを並列比較できる。

Pythonパッケージのpip installやvLLM統合も開発中だが、具体的な公開日付は未定だ。

パッケージ公開予定とローカル環境への適用

開発陣は2026年9月27日にロードマップを発表した。まずPyTorchハルネスから始め、Hugging Faceに最適化済みモデルを公開する。その後、pip install "glyd[gpu]"で環境構築し、glyd fitとpackコマンドで重みを圧縮する。

最終的にはvLLM(高速推論サーバー)を経由して推論サーバーとして動作させる予定だ。日本のローカルAI環境では、24GBや48GBのコンシューマーGPUを持つユーザーが多数存在する。Glydの適用により、従来は複数カードやクラウドが必要だった27Bクラスのモデルが、単一GPUで動作するようになる。

Qwen3.8 27BはGlyd使用時で約41GBのVRAMで収まり、48GBカードの下限ラインを大幅に下回る。今後はBlackwell GPUのサポート状況と、vLLM統合の実装速度が注目される。2026年9月27日時点でパッケージ配布の日程は未定だが、オープンソースのハルネスですぐに試験できる状態にある。

出典