8Bモデルのセキュリティ特化と推論・検証分離の設計
25秒でわかる内容解説
開発者SecFathyが8Bパラメータのオープンモデルをセキュリティ特化させた。敵対的テストで頻繁に失敗したため、推論結果をヘッドレスブラウザで検証する設計に変更した。その結果、102件のベンチマークで94.1%のPrecisionと100%のRecallを達成した。ローカルPCでモデルを動かす技術者向けに、モデルの信頼性に依存しないアーキテクチャの経緯と数値を解説する。
8Bモデルのセキュリティ特化と検証分離の設計
2026年9月27日、SecFathyはHugging Face Forumsで研究用プロトタイプ「XSS Specialist」を発表した。XSS脆弱性分析を題材に、8BサイズのオープンモデルをRetrievalやLoRA、gated continual learningで特化させた。特化の結果、複数のタスクで性能が向上した。
しかし敵対的テストで頻繁に失敗した。セキュリティ関連の識別子を少し変えるだけで、安全判定が誤るケースが繰り返された。微調整やRetrieval、複数回の試行でもその傾向は消えなかった。
基準値を下げる代わりに、プロモーションゲートが全候補をリジェクトした。これにより実験の方向性が変わった。モデルは推論や提案は行うが、真偽を確定させない設計に変更した。
実際の確認権限をモデルの外に移動した。候補のXSS検出結果は、独立した実行層であるヘッドレスブラウザがベンチマーク用シンボルを実行して初めて確定する。
I built an open-source research prototype called XSS Specialist, using XSS vulnerability analysis as the test environment.
XSS脆弱性分析をテスト環境とし、オープンソースの研究用プロトタイプ「XSS Specialist」を構築した。
| 指標 | 値 |
|---|---|
| Precision | 94.1% |
| Recall | 100% |
| False-negative rate | 0% |
| near-miss sanitizer leakage | 0.00 |
| 定義済み合格基準 | 13/13 |
変更後のシステムは、102件の凍結ライブベンチマークで94.1%のPrecisionと100%のRecallを記録した。False-negative rateは0%で、実行層の境界におけるnear-miss sanitizer leakageも0.00だった。13件の定義済み合格基準もすべてクリアした。
敵対的テストでの失敗と設計方針の転換
従来のセキュリティ特化モデル開発では、モデル自体の信頼性を高めることが主流だった。SecFathyも当初は8Bモデルの能力限界まで特化を試みた。Retrievalで知識を引き出し、LoRAでパラメータを調整し、gated continual learningで学習を制御した。
だが近接誤差テストで弱点が浮き彫りになった。識別子の微小な変更が安全判定を揺るがすため、モデル単体では決断が不安定だった。
開発者はモデルの信頼性だけでなく、モデルが間違ってもシステム全体が耐えられる設計を模索した。
結果として、モデルは推論と提案の役割に特化し、真偽の確定は外部の検証層に委ねる形になった。この分離により、モデルの失敗がそのままシステム全体の失敗に直結しなくなった。推論結果を外部で検証する仕組みは、モデルの誤判定をアーキテクチャで吸収する設計思想に連なる。
実際の確認権限をモデルの外に移動した。候補のXSS検出結果は、独立した実行層であるヘッドレスブラウザがベンチマーク用シンボルを実行して初めて確定する。
GitHub公開とコミュニティへのフィードバック依頼
開発者は2026年9月27日、コードやアーキテクチャ図、ベンチマーク、評価手法、失敗例、ネガティブ結果をGitHub「SecFathy/xss-specialist」で公開した。Hugging Face Forumsの投稿には現時点でコメントがない。しかし開発者は小モデル特化、エージェント、モデル評価、検証、AIセキュリティの分野で活動する技術者にフィードバックを求めている。
I’ve open-sourced the code, architecture, benchmarks, evaluation methodology, failures, and negative results
コード、アーキテクチャ、ベンチマーク、評価手法、失敗例、ネガティブ結果をオープンソース化した
推論と外部検証の分離は、セキュリティ特化に限らず他の領域でも応用可能だと見ている。8Bモデルという比較的小さい規模でも、適切な検証層を設けることで安定した判定が可能になる。技術者はローカル環境でモデルを動かす際、単なる精度向上だけでなく検証フローの設計を併せて検討する必要がある。
公開されたリポジトリには実行時の挙動や失敗パターンも記録されており、再現性が確保されている。写真ではXSS SpecialistのアーキテクチャとGitHubリポジトリの構成図が示されている。
合成ベンチマークでの検証と本番環境への適用
ベンチマークは合成またはローカル環境で実行された。研究段階のプロトタイプであるため、実数値は本番環境での実用性を確定させる証拠ではない。開発者はこれらの数値を即座に製品化の根拠とは見なしていない。
今後の予定として、他の領域での推論と検証分離の適用場所を探っている。2026年9月27日の公開以降、コードの改訂や追加ベンチマークの実施が進む見込みだ。
8Bモデルのセキュリティ特化実験は、小規模モデルのローカル推論における検証設計の参考になる。技術者は本番環境への移行時、合成データと実データのズレを考慮して設計を調整する必要がある。開発者はモデルの信頼性だけでなく、モデルが間違ってもシステム全体が耐えられる設計を模索した。
用語の注釈
- Precision
- 陽性と判定したうち実際に陽性だった割合を示す精度。(参考:accuracyとprecisionの違い!英語で正確さの使い方を解説)