カテゴリ: AI/LLM
"AI/LLM" の記事
テスト失敗を「人が直す」から「キューを自律消化する」へ — 監査ツール + 自律修正スキルの設計
大規模 Django プロジェクトで「pytest の全テスト → 失敗を Issue 化 → AI エージェントのループで 1 件ずつ自律修正」というテスト保守パイプラインを組んだ記録。監査ツール・冪等 Issue 同期・自律修正スキルの設計と、なぜ自動マージしないのかの安全境界を解説する。
目標駆動・自律改善システムの構築ベストプラクティス — Claude Code で自分で改善しながら回るシステムを作る
目標駆動で自律的に改善するシステムを Claude Code で作るための6つの設計原則。鮮度ガード・観測と制御の分離・サバイバーシップバイアス対策・安全ゲート付き自己改善を、実インシデントから抽出したチェックリスト付きで解説する。
自律システムはなぜ自分の欠陥に気づけないのか — Claude Code で自律システムを作るときの5つの教訓
自律トレーディングシステムで起きた「データ凍結による売り遅れ」インシデントを題材に、毎日レビューしても盲点に気づけない5つの構造的理由と、Claude Code で自律システムを作るときの教訓を解説する。
Claude Codeチーム公式ガイド「ループ設計」を読み解く — Turn-based から Proactive まで4段階の委譲
Karpathyが語るAgentic Workの未来:Claude Tag・Opus 4.8・Fable 5から読む「AI同僚」時代
更新日:KarpathyのAnthropic入社、Claude Opus 4.8のeffort controlとDynamic Workflows、Claude Tag、Fable 5/Mythos 5の輸出規制騒動を整理し、AIが組織に常駐する「Agentic Work」の流れを解説する。
Claude Code の社内設計を読み解く:ループ・CLAUDE.md・Skills・Dreaming
更新日:Anthropicのエンジニアが語ったClaude Code社内活用法——ループ設計、CLAUDE.mdとSkillsの使い分け、Dreaming機能を裏取りする。
LINEに雑メモを投げるだけで深掘りレポートが届く: Obsidian × Codex × Cloudflare の自動化ループ
LLMLOOP を読む: LLM生成コードを5つのフィードバックループで磨き上げる仕組み
LLMが生成したコードにありがちなコンパイルエラーやテスト失敗を、5つの自動フィードバックループで反復的に直していく研究 LLMLOOP を読む。HumanEval-X での pass@10 が76.22%から90.24%に改善した仕組みと、実際の著者・出典を確認した。
「動くけど雑」なAIコードを卒業する — Addy Osmaniの agent-skills
Agentic RAGの3つのパターン:Router、Self-Correction、Multi-step Retrieval