タグ: ローカルLLM
"ローカルLLM" が付いた記事と Wiki ページ
Kimi K3
Moonshot AI の 2.8兆パラメータ / 100万トークンモデル。KDA と Gated MLA のハイブリッド構成で KV キャッシュを削る「忘れ方」の設計が特徴
Kimi K3 は2.8兆パラメータより「忘れ方」が新しい — KDA で読む記憶アーキテクチャと実運用コスト
Moonshot AI の Kimi K3(2.8兆パラメータ / 100万トークン)を記憶設計から解説。KDA 69 層 + Gated MLA 24 層のハイブリッド構成、KV キャッシュ 75% 削減の意味、トークン単価と Opus 5 比較、ローカル実行が不可能な理由まで。
llama-launcher:ベイズ最適化でllama.cppの起動パラメータを自動調整するGUIツール
OSSツール llama-launcher の紹介。Optuna の TPE によるベイズ最適化で llama.cpp のスレッド数・バッチサイズ・KVキャッシュ型・投機的デコード設定を自動探索し、PPL検証で品質を保ちながら推論速度を改善する仕組みと使い方を解説。
AMD Ryzen AI Max+ 395 がAIサブスクを終わらせる — ランチボックスサイズのPCで2350億パラメータモデルが走る時代
AMD Ryzen AI Max+ 395 は x86 初の大容量 128GB 統合メモリ設計で Qwen3 235B などの巨大モデルをローカル実行可能にした。RTX 5080 比3倍の推論性能と Ollama による移行手順、年間 $5,280 のAIサブスク不要化の試算を解説。
ローカルで動くコーディングAI——Gemma 4 12B Coder(Fable 5蒸留版)を試す
更新日:VRAM 12GB で動く Gemma 4 12B Coder の GGUF 量子化バリアント比較、Ollama / llama.cpp での実行手順、Fable 5 蒸留の仕組みを解説する。
Redis 作者 antirez の "ds4" — DeepSeek V4 Flash 専用ローカル推論エンジンが M3 Ultra 512GB で 26 token/sec を叩き出す
Redis 作者 antirez が公開した DeepSeek V4 Flash 専用ローカル推論エンジン ds4(DwarfStar 4)を解説。Mac Studio M3 Ultra 512GB で 26 token/sec、KV キャッシュのディスク永続化、OpenAI / Anthropic 互換 API、Claude Code からの利用方法、2bit 非対称量子化、Exact Replay 設計まで網羅。
DeepSeek-V4 Preview — Claude Opus 4.6 匹敵・100万トークン対応のオープンソース LLM が無償公開
DeepSeek-V4 Preview は 2026 年 4 月公開のオープンソース LLM。Pro(1.6 兆パラメータ)と Flash の 2 バリアントで 100 万トークンに対応。Codeforces で GPT-5.4 を超え、MIT ライセンスで Hugging Face から無償取得可能。MoE アーキテクチャで推論演算量を 73% 削減。
Claude Code をローカル LLM(vLLM + MiniMax-M2.7)で爆速稼働させる方法
vLLM + MiniMax-M2.7 を使い Claude Code をローカル LLM で動かす方法。4× GPU / 8× GPU 構成のサーバー起動コマンド、環境変数設定、Prefix Caching による高速化、旧バージョン対応まで一通り解説する。
DFlash
Apple Silicon 向け MLX フレームワークで動作するブロック拡散型投機的デコード実装。ローカル LLM を最大 4.1 倍高速化
CanIRun.ai — ブラウザだけで自分のPCがどのローカルAIを動かせるか即判定