タグ: Abliteration
"Abliteration" が付いた記事と Wiki ページ
Abliteration(アブリテレーション)
LLM の安全性制限を再学習なしで除去する技術。拒否方向の特定と重みの直交化により、RLHF で学習された拒否行動を削除する
Gemma 4 31Bの脱獄モデル「CRACK」登場 — Abliteration技術でセーフティを除去
Google Gemma 4 31Bの安全性制限を除去した脱獄モデルCRACKの技術解説。Abliteration手法の仕組み、JANG_4M量子化で18GBに収めたスペック、HarmBenchとMMLUのベンチマーク結果を紹介。