Apple Silicon 16GB MacでQwen3.6-35B-A3BをSSDストリーミングで実行するAiiStream Q3.6の公開
25秒でわかる内容解説
開発者apirathaiyaは2026年9月29日、16GBメモリのMacで350億パラメータのMoEモデルQwen3.6-35B-A3Bを高速推論するエンジンAiiStream Q3.6をGitHubで公開した。約18GBの重みをSSDに置き、必要な分だけ読み込む仕組みだ。制御環境で1秒間に15.0トークンを生成でき、元の4bitモデルと完全一致する。ローカルPCのメモリ制約をSSD読み込み速度で補う手法として実用段階にある。
SSDからエキスパート重みを随時読み込む仕組み
AiiStream Q3.6はApple Silicon搭載Mac向けの推論エンジンである。対象のQwen3.6-35B-A3Bは350億パラメータのMoEモデル(複数の専門モデルを組み合わせる構造)で4bit量子化されている。メモリに収まらない重みをSSDに保持し、トークン生成ごとに必要なエキスパートのみを読み込む。SSDストリーミング(記憶装置から必要なデータだけを読み出す手法)により、メモリ使用量を大幅に削減する。
エンジンは次のトークンで必要となる重みを先読みする。モデルの計算信号に基づいて推測を行うため、外れても精度は変わらない。読み込みは並列で実行され、データはGPUが直接アクセスできるメモリに配置される。コピーを最小限に抑える設計だ。
制御環境では1秒間に15.0トークンを生成した。既存ストリーミングより72.6%高速で日常環境では11.8トークンになる。MLX(Apple Silicon向けの機械学習フレームワーク)メモリ使用量は最大1.7GBで、30回連続リクエストでも増加は92MB未満だった。生成トークンは元の4bitモデルとトークン単位で完全に一致する。
メモリボトルネックをSSD読み込み速度で補う設計
350億パラメータのMoEモデルをローカルで動かす場合、メモリ不足が課題だ。AiiStream Q3.6はGPUディスパッチとSSD読み込み速度がボトルネックになる点を利用した。16GB Macではファイルキャッシュが約8.9GBを占め、SSD帯域使用は8%だ。メモリ圧迫時でも11.5トークンと速度低下は緩やかだった。
比較対象のEdge0は24GBメモリとLoRA学習を必要とする。mira-coreは32GBメモリを要求する。expert-sniperは16GBだが速度は最大4.0トークンにとどまる。AiiStream Q3.6は16GBメモリで動作し出力が元のモデルとバイトレベルで同一なのが特徴である。
| プロジェクト | メモリ | 速度 |
|---|---|---|
| AiiStream Q3.6 | 16GB | 15.0 tok/s |
| Edge0 | 24GB | 14.9-17.7 tok/s |
| mira-core | 32GB | 10.8 tok/s |
| expert-sniper | 16GB | 4.0 tok/s |
動作にはmacOS 27.0とApple Siliconが必要だ。Python 3.12以降とmlx 0.32.2、mlx-lm 0.31.3を固定する。モデルダウンロードには約20GBのSSD空き容量が必要になる。OpenAI互換サーバーとして起動でき、ストリーミングとツール呼び出しに対応する。
出力一致の検証スクリプトと環境依存の速度
公開直後のコミュニティでは、特定モデル向けエンジンが公開されMacユーザーの選択肢が広がったと評価されている。apirathaiyaは出力の完全一致を証明するスクリプトを用意している。参考モデルのトークンIDとテキストのSHA-256ハッシュを比較する検証は8ケースで15から20分で完了する。
The generated tokens are identical, token for token, to the unmodified 4-bit model.
生成トークンは修正なしの4bitモデルと、トークン単位で完全に一致する。
bench.pyは同一マシンでAiiStreamと標準ストリーミングを並列実行し、デコードスループットを計測する。ラボ環境と日常環境の両方で計測でき、環境ごとの速度差を把握できる。メモリが十分にある32GB Macではメモリ保持の方が速い。バッチ処理やマルチユーザー対応を必要としない用途に適している。
8GB Macでの推論速度は9から12トークンと推定されている。16GB Macの測定結果からファイルキャッシュの容量差とSSD読み込み速度に基づいて算出された値だ。実際の速度は他のアプリの実行状況やSSDモデルによって変動する。生成は途中で切れない仕様になっている。
日本市場での普及見込みと次期モデル対応
AiiStream Q3.6はQwen3.6-35B-A3Bに特化したリリースだが、apirathaiyaは他のモデルにも対応する予定だ。各モデルごとに専用リリースが提供され、MLX標準操作のみを使用するためM1からM5まで動作する。出力の完全一致が保証されるのはmlx-lmの標準コードに対する検証結果である。
日本国内ではApple Silicon搭載Macのユーザーが多い。16GBモデル普及でSSDストリーミングによる中規模MoEモデルの実行が一般的になる可能性がある。ライセンスはApache-2.0で商用利用が無料だ。クレジット表記で自社製品に組み込める。
開発者は2026年9月29日にGitHubでソースコードを公開した。モデル重みはHugging Faceからダウンロードする形式で、ファイルのSHA-256が検証される。次回リリースでは他のQwen系MoEモデルに対応し、ローカル推論のメモリ使用基準をさらに下げる計画である。