タグ: AI安全性
"AI安全性" が付いた記事と Wiki ページ
スケーラブル・オーバーサイト
能力的に劣る人間が超知能 AI を監督するための研究領域。Anthropic の AAR プロジェクトはこの自動化を実証した
Abliteration(アブリテレーション)
LLM の安全性制限を再学習なしで除去する技術。拒否方向の特定と重みの直交化により、RLHF で学習された拒否行動を削除する
Anthropic の自動アライメント研究者(AAR):AIがAIのアライメントを加速する時代
Anthropic Mythos が哲学者マーク・フィッシャーの名前を出し続ける奇妙な現象
Anthropic の最新モデル Claude Mythos Preview が、哲学者マーク・フィッシャーの名前を自発的に言及し続ける現象について、システムカードの分析とともに解説する
Gemma 4 31Bの脱獄モデル「CRACK」登場 — Abliteration技術でセーフティを除去
Google Gemma 4 31Bの安全性制限を除去した脱獄モデルCRACKの技術解説。Abliteration手法の仕組み、JANG_4M量子化で18GBに収めたスペック、HarmBenchとMMLUのベンチマーク結果を紹介。