· ローカルAI

8Bモデルのセキュリティ特化と推論・検証分離の設計

25秒でわかる内容解説

開発者SecFathyが8Bパラメータのオープンモデルをセキュリティ特化させた。敵対的テストで頻繁に失敗したため、推論結果をヘッドレスブラウザで検証する設計に変更した。その結果、102件のベンチマークで94.1%のPrecisionと100%のRecallを達成した。ローカルPCでモデルを動かす技術者向けに、モデルの信頼性に依存しないアーキテクチャの経緯と数値を解説する。

8Bモデルのセキュリティ特化と検証分離の設計

2026年9月27日、SecFathyはHugging Face Forumsで研究用プロトタイプ「XSS Specialist」を発表した。XSS脆弱性分析を題材に、8BサイズのオープンモデルをRetrievalやLoRA、gated continual learningで特化させた。特化の結果、複数のタスクで性能が向上した。

しかし敵対的テストで頻繁に失敗した。セキュリティ関連の識別子を少し変えるだけで、安全判定が誤るケースが繰り返された。微調整やRetrieval、複数回の試行でもその傾向は消えなかった。

基準値を下げる代わりに、プロモーションゲートが全候補をリジェクトした。これにより実験の方向性が変わった。モデルは推論や提案は行うが、真偽を確定させない設計に変更した。

実際の確認権限をモデルの外に移動した。候補のXSS検出結果は、独立した実行層であるヘッドレスブラウザがベンチマーク用シンボルを実行して初めて確定する。

I built an open-source research prototype called XSS Specialist, using XSS vulnerability analysis as the test environment.

XSS脆弱性分析をテスト環境とし、オープンソースの研究用プロトタイプ「XSS Specialist」を構築した。

102件の凍結ライブベンチマークにおける検証結果
指標値
Precision94.1%
Recall100%
False-negative rate0%
near-miss sanitizer leakage0.00
定義済み合格基準13/13

変更後のシステムは、102件の凍結ライブベンチマークで94.1%のPrecisionと100%のRecallを記録した。False-negative rateは0%で、実行層の境界におけるnear-miss sanitizer leakageも0.00だった。13件の定義済み合格基準もすべてクリアした。

敵対的テストでの失敗と設計方針の転換

従来のセキュリティ特化モデル開発では、モデル自体の信頼性を高めることが主流だった。SecFathyも当初は8Bモデルの能力限界まで特化を試みた。Retrievalで知識を引き出し、LoRAでパラメータを調整し、gated continual learningで学習を制御した。

だが近接誤差テストで弱点が浮き彫りになった。識別子の微小な変更が安全判定を揺るがすため、モデル単体では決断が不安定だった。

開発者はモデルの信頼性だけでなく、モデルが間違ってもシステム全体が耐えられる設計を模索した。

結果として、モデルは推論と提案の役割に特化し、真偽の確定は外部の検証層に委ねる形になった。この分離により、モデルの失敗がそのままシステム全体の失敗に直結しなくなった。推論結果を外部で検証する仕組みは、モデルの誤判定をアーキテクチャで吸収する設計思想に連なる。

実際の確認権限をモデルの外に移動した。候補のXSS検出結果は、独立した実行層であるヘッドレスブラウザがベンチマーク用シンボルを実行して初めて確定する。

GitHub公開とコミュニティへのフィードバック依頼

開発者は2026年9月27日、コードやアーキテクチャ図、ベンチマーク、評価手法、失敗例、ネガティブ結果をGitHub「SecFathy/xss-specialist」で公開した。Hugging Face Forumsの投稿には現時点でコメントがない。しかし開発者は小モデル特化、エージェント、モデル評価、検証、AIセキュリティの分野で活動する技術者にフィードバックを求めている。

I’ve open-sourced the code, architecture, benchmarks, evaluation methodology, failures, and negative results

コード、アーキテクチャ、ベンチマーク、評価手法、失敗例、ネガティブ結果をオープンソース化した

推論と外部検証の分離は、セキュリティ特化に限らず他の領域でも応用可能だと見ている。8Bモデルという比較的小さい規模でも、適切な検証層を設けることで安定した判定が可能になる。技術者はローカル環境でモデルを動かす際、単なる精度向上だけでなく検証フローの設計を併せて検討する必要がある。

公開されたリポジトリには実行時の挙動や失敗パターンも記録されており、再現性が確保されている。写真ではXSS SpecialistのアーキテクチャとGitHubリポジトリの構成図が示されている。

XSS SpecialistのアーキテクチャとGitHubリポジトリの構成図
XSS SpecialistのアーキテクチャとGitHubリポジトリの構成図(出典:Hugging Face Forums)

合成ベンチマークでの検証と本番環境への適用

ベンチマークは合成またはローカル環境で実行された。研究段階のプロトタイプであるため、実数値は本番環境での実用性を確定させる証拠ではない。開発者はこれらの数値を即座に製品化の根拠とは見なしていない。

今後の予定として、他の領域での推論と検証分離の適用場所を探っている。2026年9月27日の公開以降、コードの改訂や追加ベンチマークの実施が進む見込みだ。

8Bモデルのセキュリティ特化実験は、小規模モデルのローカル推論における検証設計の参考になる。技術者は本番環境への移行時、合成データと実データのズレを考慮して設計を調整する必要がある。開発者はモデルの信頼性だけでなく、モデルが間違ってもシステム全体が耐えられる設計を模索した。

用語の注釈

Precision
陽性と判定したうち実際に陽性だった割合を示す精度。(参考:accuracyとprecisionの違い!英語で正確さの使い方を解説)

出典