タグ: ロングコンテキスト
"ロングコンテキスト" が付いた記事と Wiki ページ
Kimi K3
Moonshot AI の 2.8兆パラメータ / 100万トークンモデル。KDA と Gated MLA のハイブリッド構成で KV キャッシュを削る「忘れ方」の設計が特徴
Kimi K3 は2.8兆パラメータより「忘れ方」が新しい — KDA で読む記憶アーキテクチャと実運用コスト
Moonshot AI の Kimi K3(2.8兆パラメータ / 100万トークン)を記憶設計から解説。KDA 69 層 + Gated MLA 24 層のハイブリッド構成、KV キャッシュ 75% 削減の意味、トークン単価と Opus 5 比較、ローカル実行が不可能な理由まで。
Subquadratic Sparse Attention (SSA)
アテンション計算のコストをコンテキスト長の2乗からほぼ線形に削減するスパースアテンション機構。重要なk位置だけに絞ることでO(N²)→O(N×k)を実現
SubQ
マイアミのスタートアップ Subquadratic が 2026 年 5 月に発表した LLM。Subquadratic Sparse Attention で 1200 万トークン・コスト 1/5 を主張する
Claude Opus超えの新LLM「SubQ」— Subquadratic Sparse Attentionで1200万トークンを実現、コスト1/5に
Subquadraticが発表したLLM「SubQ」の仕組みを解説。Subquadratic Sparse Attention(SSA)により1200万トークン・FlashAttention比52倍高速・コスト$8(従来$2,600)を実現。Claude Opus 4.7超えのベンチマーク結果と、技術レポート未公開・独立検証なしという懐疑論まで網羅。