· ローカルAI

超軽量DiTベースTTS「EMA Lightning」が公開されローカル推論の速度基準を更新

30秒でわかる内容解説

2026年10月6日、Canberk Aslan氏が超軽量テキスト音声変換モデル「EMA Lightning」を公開した。総パラメータ860万、モデルサイズ約34MBのこのモデルは、単一話者対応のトルコ語専用だ。フリーの商用利用可能なApache 2.0ライセンスで提供され、ローカル環境での高速推論を目的とした技術者向けに設計されている。RTX 4090を搭載したPC上でリアルタイムの440倍速度を記録し、商用クラウドモデルを上回る精度を達成した。

円換算は1ドル=158.23円(2026年10月7日、欧州中央銀行の参考レート)による概算で、日本での販売価格とは異なる。

8.6Mパラメータの構成とRTX 4090における高速推論性能

本モデルはDiffusion Transformer(画像生成などで使われるTransformerアーキテクチャ)を音声学モデルに採用した構成だ。5.6Mパラメータの音声学モデルと3Mパラメータのボコーダーを組み合わせた合計8.6Mパラメータで、重みファイルは約34MBに収まる。

Freya-TR-EvalベンチマークではWER(単語誤り率)0.92%を記録し、ElevenLabs v4やGemini 3.8などの商用クラウドモデルを凌駕した。

推論速度はRTX 4090上でリアルタイムの440倍を達成する。テキスト入力から最初の音声出力まで約3.86ミリ秒で完了し、バッチ処理を併用すれば1316倍まで速度が向上する。GPUメモリは通常0.28GBで、バッチ64時は1.39GBに増加する。

CPU環境でもリアルタイムの約6倍の速度が測定されており、GPUを積んでいないノートPCでも実用的な性能を発揮する。学習データは約1000時間の単一話者トルコ語音声から構成されている。

自然性スコアUTMOSは3.30程度でElevenLabs v4と同水準だが、Gemini 3.8やTrendyol-TTSより低い数値となっている。文字誤り率CERは0.18%と極めて低く、WERの数値はWhisper大規模モデルで測定されたため認識エンジンの誤差が含まれる可能性がある。

フローマッチングによるステップ圧縮とPlayheadスケジューラーの設計

入力テキストは`normalizer-tr`によって発音形式に正規化され、文字ごとに埋め込まれる。単語と文字のタイムラインを予測するモデルが各フレームの位置を割り当て、窓付きガウス整列器が条件ベクトルを生成する。

教師モデルをDMD2で蒸留した結果、16ステップから4ステップに圧縮され、25Hzの潜在表現を生成する。NVIDIA製GPU向けに`.lightning()`メソッドを実行すると、cuDNNベンチマークモードが有効化される。

モデルは一度だけコンパイルされ、CUDA graphs(GPUの処理手順を記録して再利用する技術)が記録される。これによりバッチサイズごとの最適化が自動的に行われ、推論パイプラインの遅延が大幅に削減される。

Playhead(内部スケジューラー)が複数スレッドの処理を統合する。RTX PRO 6000上で64ストリームを同時に開始した場合、0.74秒で887秒分の音声を生成した記録が残っている。

下図ではテキストエンコーダーからDiT、デコーダーへのデータフローが示されている。

EMA Lightning architecture
テキストエンコーダーからDiT、デコーダーへのデータフローを示す構成図(出典:Hugging Face trending)

ストリーミング対応と低コスト推論によるローカル開発環境への適合

Hugging Faceでの公開後、すぐにtrendingリストにランクインした。コードはGitHubで公開され、Pythonパッケージ`ema-lightning`としてpip install一発で導入可能だ。APIキーを必要とせず、テキストも音声もマシン内で完結するため、通信環境が不安定な環境やデータ漏洩を気にする開発者にサポートされている。

音声生成はストリーミング対応しており、テキストの残りが処理されている間に最初の音声が出力される。1秒分のチャンクを約4ミリ秒で生成し、その後は4秒分ずつリアルタイムの倍以上の速度で配信される。

first audio in 3.86 ms and 440× faster than real time on an RTX 4090

最初の音声は3.86ミリ秒で生成され、RTX 4090上でリアルタイムの440倍の速度を記録する。

推論コストはRTX 4090を時価0.74ドル(約117円)で借りた場合、100万文字あたり約0.0085ドル(約1円)となる。バッチ処理を適用すれば6時間7分のオーディオブックが約17秒で生成可能だ。

単一話者だが感情制御や音声クローニングは非対応で、外国語はトルコの綴り規則で読み上げる。銀行や医療のメッセージでは自動正規化のミスが起きるため、人間による確認が推奨されている。

EU AI Actなど多くの地域で合成音声の告知が義務付けられており、利用時の表記規則に準拠する必要がある。

Apache 2.0ライセンスの商用利用と独立評価セットでの精度検証

2026年10月6日に公開された重みファイルはApache 2.0ライセンスで商用利用が許可されている。単一話者トルコ語専用だが、GPUやCPUのどちらでも動作しオフライン環境で使用できる。

EMA Lightningと既存軽量モデルの比較
モデル名パラメータ数RTX 4090速度
EMA Lightning8.6Mリアルタイムの440倍
Piper16Mリアルタイムの15倍
Coqui GlowTTS28Mリアルタイムの63倍

比較表ではPiperやCoqui GlowTTSなどの既存軽量モデルが並列掲載されている。EMA LightningのアーキテクチャはこれらのモデルよりもDiTを採用しており、フローマッチングによる生成ステップの圧縮が高速化の鍵となっている。

Trendyol-TTSのような大規模パラメータモデルと比較しても、メモリ使用量を抑えながら精度を維持している。起動時にコンパイルパスが元の実行パスと照合され、最適化が検証される仕組みとなっている。

用語の注釈

DiT
拡散モデルの画像生成などで使われるネットワーク。Transformerアーキテクチャを採用し、U-Netに代わる基盤技術となっている。(参考:DiT(Diffusion Transformer)を徹底解説 — 拡散モデルのU-Net ...)
WER
テキストと音声認識結果の文字列を比較し、誤りの割合で音声がテキストにどれだけ正確に一致したかを数値化した評価指標である。(参考:音声認識の評価指標まとめ|WERとCERの違いと選び方 ...)
CUDA graphs
NVIDIA製GPUの並列計算を用い、処理手順を記録して再利用することで推論を高速化する。(参考:CUDAって何?まとめてみたらNVIDIAの凄さがわかった。)

出典