技術の記事

AI駆動開発の実装・つまずき・設計の知見。手を動かした一次情報として綴ります。

tech技術69 · 2/8ページ
技術Codex Microとは何か ──OpenAI初のハードウェアが示す、AIエージェントを"監督する"仕事

Codex Microとは何か ──OpenAI初のハードウェアが示す、AIエージェントを"監督する"仕事

OpenAIが初めて作ったハードウェアは、AIにコードを書かせる道具ではなく、AIエージェントを見て承認・却下するための230ドルのキーパッドだった。2026年7月15日発売の「Codex Micro」の仕様と4つの操作系から、AI開発の詰まりどころが「書く」から「見て決める」へ移った変化を解説する。

甲斐ショウジ8分で読めます
技術Claude Codeの設定・スキル・メモリをgitで守る ──~/.claude を丸ごと履歴管理する方法

Claude Codeの設定・スキル・メモリをgitで守る ──~/.claude を丸ごと履歴管理する方法

Claude Codeの設定・スキル・メモリは、gitの「全部除外→資産だけ許可」方式で丸ごと履歴管理できる。秘密の混入を防ぐ設定ファイル(コピペ可)と3回の安全チェック、三日坊主にしない仕組みまで、実体験ベースで解説する。

甲斐ショウジ7分で読めます
技術AIエージェントは、追い詰められると意図に反して動く ──Anthropicが14モデルで検証した"誤整合"の実験を解説

AIエージェントは、追い詰められると意図に反して動く ──Anthropicが14モデルで検証した"誤整合"の実験を解説

Anthropicが2026年7月13日、権限を持つAIエージェントが追い詰められた状況で開発者の意図に反して動きうることを14モデルで再現した研究を公開した。秘密のコード改ざんや詐欺の隠蔽など4つの失敗モードと、導入前に決めるべき権限設計・HITL・監査ログ・逃げ道の4点を、専門用語なしで解説する。

甲斐ショウジ9分で読めます
技術DeNAのClaude Code活用事例を解説 ──仕様からモックまで「2週間→1〜2日」になった仕組み

DeNAのClaude Code活用事例を解説 ──仕様からモックまで「2週間→1〜2日」になった仕組み

DeNAが公開したClaude Codeのチーム活用事例を解説する。速くなったのはコーディングではなく職種間の“受け渡し”で、仕様確定からモック確認までが2週間〜1ヶ月→1〜2日に。PdM・デザイナー・エンジニアが同じAIを使う仕組みと、真似する前の注意点まで。(DeNA公式ブログベース・CAG非検証)

甲斐ショウジ7分で読めます
技術ChatGPT Workとは何か ──AIが資料まで作って仕事を「完了」させる新機能を解説

ChatGPT Workとは何か ──AIが資料まで作って仕事を「完了」させる新機能を解説

2026年7月9日、OpenAIがGPT-5.6と同時に発表した「ChatGPT Work」を分かりやすく解説する。AIに“ゴール”を渡すと、社内のファイルやアプリから情報を集め、複数のAIが手分けして作業し、スライド・シート・ドキュメントといった成果物に仕上げ、人の承認と記録を挟んで仕事を完了まで運ぶ——ChatGPTが「質問に答える道具」から「仕事を任せられる場所」に変わり始めた。何が変わったのか、何が新しいのか、実際の仕事で何に使えるのか、任せる前の注意点までを専門用語なしで整理。“仕事OS”の7層、GPT-5.6の実行エンジン(ultra・Programmatic Tool Calling・multi-agent)、“全部任せ”が失敗する境界設計も扱う(OpenAI公式ベース・CAG非検証)。

甲斐ショウジ9分で読めます
技術AIが、4.66億行を20時間で監査した ──Alberta州政府 × Claude Code が示す、大規模コードレビューの“型”

AIが、4.66億行を20時間で監査した ──Alberta州政府 × Claude Code が示す、大規模コードレビューの“型”

AIがコードを「書く」話はもう聞き飽きたかもしれない。今回は毛色が違う——AIが4億6600万行を20時間で“監査”した。2026年7月6日、Anthropicがカナダ・Alberta州政府の事例を公開。1,280アプリ・3,400リポジトリを、Claude Code(Opus/Sonnet)と約50体の並列エージェントでセキュリティレビュー(従来推定6.5年)。肝は規模でなく“やり方”=丸投げでない。①ルールエンジンで既知パターンをflag→②AIがreviewしてfile/lineで引用→③人が承認→④継続エージェント(red team/blue team/code quality・app毎に約95項目)。修正・テスト・ビルド生成、レガシー再構築(Java補助金ポータル5ヶ月→4-5日)まで。「機械の網羅×AIの判断×人の承認×継続監視」の型として、古いコード棚卸し・RLS/権限レビューに翻訳できる。数字はベンダー事例で第三者検証ではない旨も明記。AIの主戦場が「書く」から「点検し続ける」へ動いた話(Anthropic公式ベース・CAG非検証)。

甲斐ショウジ7分で読めます
技術プロンプトとスキルは、もう「メモ」じゃない ──AIへの指示を“本番資産”として管理し始めた各社(Mistral / GitHub / Google)

プロンプトとスキルは、もう「メモ」じゃない ──AIへの指示を“本番資産”として管理し始めた各社(Mistral / GitHub / Google)

AIにやらせる「指示」——プロンプト、スキル、AGENTS.md——が本番の挙動をそのまま決めているのに、多くの現場ではまだ「メモ」扱い。repoやnotebook、Slackに散らばり、誰が最後に直したかも分からない。2026年6〜7月、この扱いを変える動きがMistral・GitHub・Googleからほぼ同時に出てきた。Mistral Studioは prompts/skills に system of record(版固定・比較・named owner・変更ログ・staging→tagged production・rollback)。GitHub Agent Finderは全ツールを手配線せず、タスクを言葉で書くと許可registryを検索してranked matchesを都度取り込む(オープン規格ARD)。Google Managed Agentsは AGENTS.md/SKILL.md をversionableファイルで定義。「良いプロンプトを書く」の次は「管理されたプロンプト資産」——3社が同じ山を登る流れを分かりやすく解説(仕様は各社公式ベース・CAG非検証)。

甲斐ショウジ8分で読めます
技術AIを「どれだけ使ったか」より、「何を任せたか」を振り返る時代へ ──Claude Reflectが機能にした、AI利用のメタ認知

AIを「どれだけ使ったか」より、「何を任せたか」を振り返る時代へ ──Claude Reflectが機能にした、AI利用のメタ認知

AIを使うこと自体はもう珍しくない。次に出てくる問いは「自分はAIに何を任せ、任せすぎていないか、どこで判断を残しているか」。2026年7月9日、AnthropicはこれをClaudeの新機能Reflect(monthly recap・ベータ)としてプロダクト化した。単なる利用レポートではなく、AIの使い方そのものを振り返る=メタ認知を機能にした点が新しい。対象はFree/Pro/Max・web/Desktop・memory有効(Team/Enterprise未提供)。テーマ別割合・ピーク時間・会話数、任意のbreak reminder/quiet hours、そして4D AI Fluency(Delegation/Description/Discernment/Diligence)での振り返り。※現状Cowork・Claude Codeは対象外、利用時間表示は“近日”。成果物だけでなく“人が判断した場所”を残すことがPDCAになる——という視点で分かりやすく解説(機能・数値はAnthropic公式/Help Centerベース・CAG非検証)。

甲斐ショウジ8分で読めます
技術GPT-5.6を、分かりやすく ──Sol / Terra / Luna、3つに分かれた新モデル家族の読み方

GPT-5.6を、分かりやすく ──Sol / Terra / Luna、3つに分かれた新モデル家族の読み方

2026年7月9日、OpenAIがGPT-5.6を一般公開した。ChatGPT・Codex・APIに同時に。今回の特徴は、モデルが1つではなくSol・Terra・Lunaの3つに分かれて出てきたこと。数字(5.6)が世代、名前が“性格(能力ティア)”を表す新しい命名だ。難しい仕事はSol($5/$30)、日常はTerra($2.50/$15)、反復はLuna($1/$6)。共通スペックは100万トークン文脈・最大出力128k・知識カットオフ2/16。Sol Ultra Mode(サブエージェント)でTerminal-Bench 2.1が88.8→91.9%、一方SWE-Bench Proは上位に差=“最強”ではない。Programmatic Tool CallingやMulti-agent、キャッシュ90%オフも。安全対策は約10倍だが長時間タスクは監督必須。「どれを使う?」に答える解説(数値はOpenAI公式/二次情報ベース・CAG非検証)。

甲斐ショウジ9分で読めます