· ローカルAI

16GB Macで35Bモデルを15トークン秒に最適化するストリーミング手法

35秒でわかる内容解説

開発者apirathaiyaは2026年10月1日、16GBメモリ搭載のM5 MacBook AirでQwen3.6-35B-A3Bを15.0トークン/秒で推論するAiiStream Q3.6を公開した。MoE構造の重みをSSDに保持し、ルーターが選択した専門家のみを読み込む仕組みだ。MacやApple Silicon搭載PCで大容量モデルをローカル実行する技術者向けに、Apache-2.0ライセンスでソースコードが提供される。メモリ使用量は約1.7GBに抑えられ、既存のmlx_lmと出力が完全に一致する。ローカル推論のボトルネックだったSSD読み込み速度を劇的に改善した。

16GB Macで35Bモデルを15トークン秒に最適化するストリーミング手法

本技術の核心はMoE(Mixture of Experts。モデルの重みを複数の専門家に分割し、入力に応じて必要な専門家のみを活性化させる推論構造)を活用したストリーミング手法にある。35Bパラメータを誇るQwen3.6-35B-A3Bは通常、16GBのメモリを余裕で超える重みを持つ。

従来のDirect SSDストリーミングでは読み込み速度がボトルネックになりがちだった。AiiStream Q3.6は、必要なExpertsをSSDから逐次読み込むだけでなく、次のレイヤーで必要となるExpertsを事前に予測して非同期ロードを開始する。これにより、メモリフットプリントを約1.7GBに抑えつつ、推論パイプラインの待ち時間を最小化した。

検証環境は16GB RAM搭載のM5 MacBook Airである。制御されたベンチマークでは15.0トークン/秒の速度を記録した。直接SSDから読み込む手法と比較すると、処理速度が72.6%向上した結果となった。

実使用時にも他のアプリケーションを起動した状態では11.8トークン/秒を維持する。短いプロンプトに対する最初のトークン生成までの待ち時間は2.3秒程度だった。メモリ割り当てはMLX向けに最適化されており、オーバーヘッドが極めて小さい。

M5 MacBook Airにおける推論パフォーマンス
項目値
16GB M5 MacBook Air推論速度15.0トークン/秒
他アプリ起動時の速度11.8トークン/秒
最初のトークン生成まで2.3秒
MLXメモリ使用量約1.7GB
直接SSDストリーミング比72.6%高速化

開発者は2026年10月1日にGitHubでソースコードを公開した。下の画像は公開直後のGitHubリポジトリ画面を示している。ライセンスはApache-2.0であり、商用利用や改変も制限が少ない。

Apache-2.0ライセンスで公開されたAiiStream Q3.6のGitHubリポジトリ画面
Apache-2.0ライセンスで公開されたAiiStream Q3.6のGitHubリポジトリ画面(出典:Hugging Face Forums)

技術的な実装はMLXフレームワークを基盤としており、Appleの推論環境に特化した最適化が施されている。

Apple Silicon向けメモリ帯域とExperts配置の技術的背景

Apple Silicon搭載Macのユニファイドメモリアーキテクチャは、CPUとGPUが同じメモリを共有するため、VRAM不足に悩まされにくい利点がある。一方で、SSDの読み書き速度がメモリ帯域の上限となるため、35B超の大規模モデルを推論する際、データ転送が最大の課題となっていた。この課題に対して、開発者はExpertsをSSDに常駐させ、ルーターの指示に従って必要分だけをオンメモリに展開する設計を採用した。

35Bパラメータの重みを4bit量子化しても全体サイズは大きいため、全Expertsを一度にロードすると16GBメモリを圧迫する。先行するローカル推論ライブラリでは、モデル全体をメモリに展開するか、ランダムアクセスでSSDから読み込む方式が主流だった。AiiStream Q3.6は、メモリ使用量を約1.7GBに固定したまま、Expertsの読み込み順序を最適化することで速度差を生み出した。

I got Qwen3.6-35B-A3B running on a 16 GB M5 MacBook Air by keeping the routed experts on SSD and reading only the ones selected by the MoE router.

MoEルーターが選択したExpertsのみを読み込み、他のExpertsはSSDに保持した状態で16GB M5 MacBook AirでQwen3.6-35B-A3Bを動作させた。

Apple SiliconのMLXフレームワークは、メモリ帯域の効率的な利用を前提としている。開発者はこのアーキテクチャの特性を活かし、Expertsのストリーミング順序を制御するロジックを実装した。これにより、メモリ割り当てのオーバーヘッドを最小限に抑えつつ、推論の連続性を保っている。

重みの分割方式は変更せず、トップ8ルーティングをそのまま維持している。これにより、モデルの学習済み知識が欠落することなく、出力のバイト列は標準版mlx_lmと完全に一致する。

8GB Mac向け推定値とコミュニティの初期検証状況

Hugging Face Forumsで公開された本稿には、現在コメントは付いていない。技術的な詳細がコードとベンチマーク結果で明確に示されたため、初期段階では検証が中心となっている。開発者は16GBモデルでの直接テストを完了させたが、8GB搭載のMacでも動作するように設計されている。

8GB Macにおけるパフォーマンス数値は現時点で推定値である。メモリ容量が半減するため、Expertsのキャッシュ効率が低下し、SSD読み込み頻度が増える可能性がある。それでも設計思想自体は8GB環境でも適用可能であり、低スペックMacユーザーにとっての選択肢が増える見込みだ。

開発者は8GB Macのパフォーマンス数値は現時点で推定値としている。出力の再現性も重視されており、シード値を固定すれば標準版と同じ結果が得られる。これにより、既存のワークフローや評価スクリプトをそのまま流用できる。

技術的には、Expertsのストリーミング順序を制御するロジックが核となっている。メモリ使用量の低さは実機検証前から確認済みである。

8GBベンチマーク公開予定と日本国内での活用見通し

資料に日本での発売や価格に関する記載はないため、今後の展開と未確定の点を中心にまとめる。開発者は2026年10月1日に公開したAiiStream Q3.6をベースに、8GB Macでの直接テストを継続中だ。推定値の数値が確定次第、ベンチマーク結果が更新される。

MoEストリーミング技術はQwen3.6-35B-A3B向けに最適化されているが、同じアーキテクチャを持つ他のモデルへの適用も視野に入っている。MLX対応の4bit量子化モデルなら、重みの読み込みロジックを流用できる可能性が高い。日本国内のローカルAI愛好家にとっても、16GB Macでの実用速度が15トークン/秒を超えた点は大きい。

他のアプリを起動していても11.8トークン/秒を維持する安定性は、日常のチャットやコード生成に十分耐えうる水準だ。8GB Mac向けにはメモリ使用量をさらに圧縮する設計が施されている。Expertsのキャッシュ戦略を変更すれば、8GB環境でも15トークン/秒に近い速度が期待できる。

開発者は8GB Mac向けのパフォーマンス数値について、今後直接テストの結果を更新する予定だ。

用語の注釈

MoE
モデルの重みを複数の専門家に分割し、入力に応じて必要な専門家のみを活性化させる推論構造。(参考:LLM の「Mixture of Experts (MoE)」を完全に理解する:なぜ ...)

出典