CATEGORIES · 03 / 05
AI
モデル、プロンプト、alignment の周辺。数値と哲学の境界線で書く記事。(68 本)

Anthropic SDK の Managed Agents デプロイ対応を運用者目線で読む
anthropic-sdk-python v0.109.0 が Managed Agents のデプロイと環境変数クレデンシャルに対応しました。Claude を「呼ぶ API」から「エージェントを走らせる実行環境」へ広げる更新を、どこまで Anthropic に預けるかという運用者の判断軸で読みます。

MiMo-V2.5-Pro UltraSpeed で 1T モデルが 1000 tokens/s — 数字の前提を運用者目線で読む
Xiaomi の MiMo が 1 兆パラメータの MoE モデルでデコード 1000 tokens/s 超を出したと発表しました。確かに速いのですが、これは batch やレイテンシの前提が書かれていない decode 速度の話です。何の速度なのかを MXFP4・DFlash・TileRT の三段に分解し、運用者として鵜呑みにする前に確認したい点を整理します。

「最小の脳」パーセプトロンを Python でゼロから書いて、LLM 全盛の今に読み直す — 運用者目線で
1958 年生まれのパーセプトロンは、入力に重みを掛けて足して 0 と比べるだけの「最小の判定器」です。LLM が当たり前になった 2026 年に、あえてこの一番小さい学習機械を Python でゼロから書き直し、運用者として何が嬉しいのかを測り直しました。

LLM API のコスト暴走を「呼ばない」で防ぐ三段防御 — 運用者目線で
個人開発で生成 AI 機能を載せると API 課金が青天井になりがちです。入力ゲーティング・キャッシュ・軽量モデルへのフォールバックという『そもそも呼ばない』方向の三段防御を、Zenn の実装事例を起点に運用者目線で整理しました。

Meta の AI チャットボットが 2 万件超の Instagram 乗っ取りに使われた — 運用者目線で読む
Meta が 2026 年 6 月 6 日に Instagram の大量乗っ取りを認めました。原因は派手なゼロデイではなく、復旧用 AI チャットボットの確認漏れで、攻撃者の宛先にリセットリンクが飛んでいた件です。AI に操作権限を渡すことの危うさを、運用者目線で読みます。

Claude は rsync のバグを増やしたのか — 36 リリースの統計を運用者目線で読む
rsync v3.4.3 のバグは AI のせいだと言われました。36 リリースの履歴で検証すると、Claude が原因という統計的証拠は出ていません。順列検定 p=46%、変更量は 5 倍でもバグ密度は同じ。単発事例を分布に戻す読み方を運用者目線で整理します。

Anthropic の脆弱性発見ハーネスを運用者目線で読む — Claude に C/C++ のバグを探させる
Anthropic が defending-code-reference-harness をオープンソース公開。脅威モデリング / スキャン / トリアージ / パッチ用の 5 つの Skill と、コードを実行して攻める 7 段の自律ハーネスで構成されています。Claude Opus 4.6 が OSS から 500 件超の脆弱性を見つけたという主張も含め、何が嬉しく何が難しいかを運用者目線で読みます。

Gemma 4 12B を運用者目線で読む — encoder-free で 16GB に載る統合マルチモーダル
Google が 2026 年 6 月 3 日に Gemma 4 12B を公開。vision encoder を単一行列積の埋め込みに置き換え、audio encoder は撤去する encoder-free 構成で、16GB の VRAM / unified memory があればラップトップで動きます。Apache 2.0 ライセンスの統合マルチモーダルモデルを、ローカル運用者の目線で読み解きます。

Microsoft MAI-Code-1-Flash を運用者目線で読む — 自社製コーディングモデルと「60% 少ないトークン」
Microsoft AI が 2026 年 6 月 2 日に発表した軽量コーディングモデル MAI-Code-1-Flash。Copilot harness 専用に焼いた自社製モデル路線と、SWE-Bench Pro の数字・トークン効率の主張を、API を毎日叩く運用者の目線で読みます。提灯ではなく、明日の選択に効く読み方を書きます。

Stanford CS336「LLM をゼロから作る」を、API 運用者目線で読む
Stanford CS336 は言語モデルをゼロから実装させる講義です。自分で学習しない API 運用者にとっても、tokenizer・推論・アライメントという「課金している層の地図」になる。5 課題を自分の請求書の注釈として読み替えます。