CATEGORIES · 03 / 05

AI

モデル、プロンプト、alignment の周辺。数値と哲学の境界線で書く記事。(68 本)

openai-python v3.0.0 の HTTPX2 移行を運用者目線で読む
AI

openai-python v3.0.0 の HTTPX2 移行を運用者目線で読む

openai-python v3.0.0(2026-08-12)は HTTP クライアントの既定を HTTPX2 にし、httpx を自動インストールしなくなりました。消えた依存と TLS trust store の切り替え、custom client の対応表、legacy escape hatch、依存ピン留めと段階移行の手順を運用者目線で整理します。

2026年8月13日 09:05
DeepMind 体制再編を運用者目線で読む — Hassabis 会長就任と Jeff Dean 退任
AI

DeepMind 体制再編を運用者目線で読む — Hassabis 会長就任と Jeff Dean 退任

2026 年 8 月、Google DeepMind の Demis Hassabis が会長へ、Jeff Dean が退任しました。フロンティアラボの体制再編を、モデル供給と単一プロバイダ依存の点検という運用者目線で整理します。

2026年8月6日 09:06
Gemini 最新モデルで temperature / top_p / top_k が無視される — サンプリング廃止を運用者目線で読む
AI

Gemini 最新モデルで temperature / top_p / top_k が無視される — サンプリング廃止を運用者目線で読む

Gemini API 公式ドキュメントが、最新世代のモデルでは temperature・top_p・top_k を deprecated かつ無視すると明記しました。将来世代では HTTP 400 になります。何が効かなくなり、既存コードのどこを直し、代わりに何で出力を制御するかを運用者目線で整理します。

2026年7月23日 09:09
975B の open-weights は誰が動かすのか — Inkling を運用者目線で読む
AI

975B の open-weights は誰が動かすのか — Inkling を運用者目線で読む

Thinking Machines Lab が公開した open-weights モデル Inkling は、総パラメータ 975B / active 41B。個人の機材にはまず載らない。それでも運用者に効く理由を、thinking effort によるコスト制御、effort=0.99 前提のベンチマーク、そして「借り先を選べる」という exit の観点から読み解く。

2026年7月16日 09:08
コーディング評価の signal と noise を運用者目線で切り分ける
AI

コーディング評価の signal と noise を運用者目線で切り分ける

2026 年 2 月、OpenAI がコーディングベンチマークの noise を実名で開示しました。壊れたテスト・データ汚染・統計のばらつきという 3 つの noise を、自組織で AI コーディングツールを評価する運用者の目線で切り分ける方法を、信頼区間と内製 eval の観点から整理します。

2026年7月9日 09:07
ZCode を運用者目線で読む — GLM-5.2 の公式ハーネスとロックインの綱引き
AI

ZCode を運用者目線で読む — GLM-5.2 の公式ハーネスとロックインの綱引き

GLM-5.2 を作った Z.ai が、自社モデル専用のコーディング・ハーネス ZCode を公開しました。Goals による長時間タスク、遠隔ステアリング、3 段の料金を確かめつつ、モデル提供者が自前ハーネスを出す構図を最適化とロックインの綱引きとして運用者目線で読みます。

2026年7月2日 09:06
OpenAI 初の自社チップ Jalapeño を運用者目線で読む — 自社シリコンは API 利用者に何をもたらすか
AI

OpenAI 初の自社チップ Jalapeño を運用者目線で読む — 自社シリコンは API 利用者に何をもたらすか

OpenAI が初の自社設計チップ Jalapeño を 2026 年 6 月に発表しました。Broadcom と共同設計した推論専用チップで、初期デプロイは 2026 年末予定。NVIDIA 依存を下げるこの自社シリコンが、API 利用者の価格・可用性・ロックイン・供給主権に何を意味するかを運用者目線で 4 つの論点に整理します。

2026年6月25日 09:12
Moebius を運用者目線で読む — 0.2B の画像インペインティングが 10B 級に並ぶとき
AI

Moebius を運用者目線で読む — 0.2B の画像インペインティングが 10B 級に並ぶとき

わずか 0.22B パラメータの画像インペインティングモデル Moebius が、11.9B の FLUX.1-Fill-Dev と 6 ベンチで同等以上を主張しています。「2% のサイズで並ぶ」という数字を、運用コスト・推論速度・オンデバイス展開・採用前チェックの観点で運用者目線に翻訳し、ベンチの『匹敵』をそのまま信じる前に確かめるべき点を整理します。

2026年6月23日 12:07
Apertus を運用者目線で読む — 完全オープンモデルと Sovereign AI の損得
AI

Apertus を運用者目線で読む — 完全オープンモデルと Sovereign AI の損得

重み・学習データ・学習レシピまで全公開する基盤モデル Apertus を、自前で運用する側の損得で読み直します。Sovereign AI が解くのは賢さではなく依存のリスクで、完全オープンの実利は監査のしやすさにありました。品質ギャップと撤退の容易さも踏まえ、全面置換ではなく保険として持つ構えを整理します。

2026年6月22日 12:08
大きいモデルほど幻覚が減るは成り立つか — AA-Omniscience を運用者目線で読む
AI

大きいモデルほど幻覚が減るは成り立つか — AA-Omniscience を運用者目線で読む

AA-Omniscience の幻覚率ベンチで、商用大型の GPT-5.5 が 86%、MIT ライセンスでより小さい GLM-5.2 が 28%。「大きいほど幻覚が減る」という直感が崩れた結果を入り口に、知能指数と幻覚率という別々の軸をどう読み分け、自分のタスクでどう測るかを運用者目線で整理しました。

2026年6月21日 12:06