← すべての記事

MLXでMacの上にエージェントAIを動かす

WWDC 2026で、AppleのエンジニアがMac上のローカルエージェントに、MLXリポジトリの最近のプルリクエストを取得し、変更内容を要約し、注意すべき点を指摘するよう依頼しました。モデルは推論し、GitHub CLIを呼び出し、差分を読み、要約を生成しました。ネットワークに触れたのはgitコマンドだけで、モデルは完全に彼のハードウェア上で動作したのです。1 このデモこそ、本稿の主旨そのものです。エージェントのループ、つまりモデルが判断し、ツールを呼び出し、結果を観察し、また判断するという部分が、いまやMLXを使ってMac上でローカルに動くようになりました。クラウドも、APIキーも、トークンあたりの課金もありません。そしてAppleは、その物語の残りも同時に出荷しました。このループを複数のMacにわたってスケールさせる方法、新しい種類の攻撃に対してエージェント機能をセキュアにする方法、そしてループが静かに誤った動作をしたときにデバッグする方法です。

本稿では、WWDC 2026の4つのセッションをたどります。これらは合わさることで、Mac上のローカルエージェントAIを単なる技術デモではなく、現実のエンジニアリングの対象にしてくれます。以下の内容はすべて、これらのセッションから直接得たものです。

TL;DR

  • MLXは、4層からなるスタックを通じて、エージェントのループ全体をMac上でローカルに動かします。基盤となるMLX、モデルを扱うMLX-LM、OpenAI互換のHTTPサーバーであるMLX-LM Server、そしてその上にOpenAIのchat completionsプロトコルを話す任意のエージェントです。1
  • セットアップは3ステップです。MLX-LMをpip installし、ツール呼び出し対応のモデルでmlx_lm.serverを実行し、エージェントのベースURLをlocalhostに向けるだけです。1
  • 1台のMacでは足りないとき、MLXはThunderbolt 5上でRDMAとAppleのオープンソースライブラリJACCLを使い、モデルを複数のMacに分散します。これにより1兆パラメータ級のモデルを動かし、4ノードのクラスタでは推論とファインチューニングをおよそ3倍に高速化します。2
  • エージェント機能は新たな攻撃対象、すなわち間接プロンプトインジェクションを開きます。Appleの緩和策は決定論的なガードレールに重きを置いています。Foundation Modelsの.onToolCallによる確認と.historyTransformによるスポットライト、そしてApp Intentsのリスクベースの確認とロック画面認証です。3
  • Xcode 27のFoundation Models Instrumentは、ループを観測可能にします。リクエストごとのレーン、モデルの思考連鎖のツリービュー、そしてサイレント障害や遅い推論を捉えるために必要なメトリクス(Time to First Token、Tokens per Second、Total Latency)です。4

ローカルエージェントスタック(セッション232)

Watch on Apple Developer ↗

MLXチームのAngelosが、2:42から3ステップのセットアップを解説します。

多くの開発者が知っているチャット体験では、作業が人間側に戻ってきます。セッションはこう表現しています。「あなたは言語モデルにプロンプトを送る。モデルは応答を返す。その応答に基づいて何かをする必要があるなら、コマンドを実行する、ファイルを確認する、エラーを修正する、それはあなたの仕事だ」1 エージェントはそのギャップを埋めます。エージェントはモデルと対話して何をすべきか判断し、ツールを呼び出して実行し、結果を観察し、次のステップのためにモデルへ戻ります。ユーザーからエージェントへ、エージェントからモデルへ、エージェントからツールへ、タスクが完了するまで循環するのです。

このループがApple siliconの上で興味深いのは、そのすべてがローカルで動く点です。MLXはこの能力を、下から順に4層として提示します。計算、Metalによるアクセラレーション、メモリを扱う「Apple silicon専用に作られた、私たちのオープンソースの配列フレームワーク」であるMLX、Hugging Faceからモデルを読み込み、実行し、量子化し、ファインチューニングするためのMLX-LM、構造化されたツール呼び出しと推論モデルのサポートを備え「ローカルモデルを標準的なAPIを通じて公開するOpenAI互換のHTTPサーバー」であるMLX-LM Server、そして最上層には、Xcodeであれ、OpenCodeであれ、Piエージェントであれ、カスタムスクリプトであれ、OpenAIのchat completionsプロトコルを話す任意のエージェントです。1 この標準インターフェースこそが支柱となる選択でした。「どんなエージェントフレームワークもそのまま動作する」のであり、Ollama、LM Studio、vLLMといったツールはすでにMLXとMLX-LMの上に構築されています。1

セットアップは3ステップです。1回のpip installでMLX-LMをインストールします。ツール呼び出し対応のモデルでサーバーを起動します。

mlx_lm.server --model <a-tool-calling-model>

そして、エージェントのベースURLをlocalhostに設定して、ローカルサーバーへ向けます。セッションが述べるとおり、「エージェントは、モデルがクラウドではなくあなたのMac上で動いていることを知らないし、気にもしない」のです。1 OpenCodeの場合、URLがlocalhostでモデル名がサーバーの期待する値に一致するローカルプロバイダーを定義し、そのうえでOpenCodeにすべてでそのローカルモデルを使うよう指示します。

興味深いのは、MLXがエージェントワークロードに対して特にどう実力を発揮するかです。セッションは3つの課題を挙げています。1つ目はプロンプト処理です。「エージェントのセッションは通常、数十万トークンに及び、そのほとんどは生成されたものではない」1 モデルはツール出力を受け取るたびに、さらに推論する前にその新しいコンテキストをすべて処理し、そのコストはループ全体を通じて繰り返し発生します。M5チップ専用のNeural Acceleratorは行列乗算をM4の4倍速くし、MLXの専用カーネルと相まって、「これはほぼそのままプロンプト処理の高速化に変換され」、特別な引数もコード変更も必要ありません。1 2つ目の課題は並行性です。エージェントはサブエージェントを生成し、MLX-LM Serverは継続的バッチングで同時リクエストを処理し、それらを動的にまとめることで、サブエージェントが「キューで待たされて止まる」ことがないようにします。1 3つ目の課題はモデルのサイズで、ここから次のセッションが引き継ぎます。

Angelosは、読み取って報告するだけにとどまらないデモで締めくくりました。空のXcodeプロジェクトから、彼はエージェントにiPad向けのSwiftUIお絵描きアプリを作るよう依頼しました。エージェントはディレクトリを調べ、計画を立て、コードを書き、xcodebuildを使ってコンパイルし、自身のエラーを修正し、約2分で動くアプリを作り上げ、さらに依頼に応じて丸い端点を追加するよう反復しました。1 最後のデモでは、同じ実行中のMLXサーバーを、ローカルにホストされたチャットプロバイダーとしてXcodeのIntelligence設定に組み込みました。これによりXcode自身が、仕込まれたバグを見つけて修正できたのです。「ローカルAIとは、あなたのコードが決してMacから出ていかないということです」1

複数のMacへのスケール(セッション233)

Watch on Apple Developer ↗

Tatianaが、2:21から4台のMacによるクラスタを一歩ずつ構築します。

やがて、1台のマシンでは手狭になります。MLXチームのリサーチサイエンティストであるTatianaはこう表現しました。「最終的には、1台のマシン上のメモリ、計算、帯域幅が制約になる」2 セッション232で取り上げた象徴的なケースは、そもそも収まらないモデルです。最新のDeepSeekモデルは「なんと1.6兆ものパラメータを持ち、重みだけで800GB超のメモリを必要とする」のです。1 セッション233は、その作業を自分の所有するMacにわたって分散する方法を深掘りします。

分散MLXの土台となるスタックには3つの要素があります。インターコネクトとトランスポート。macOS 26.2から、Thunderbolt 5上でRemote Direct Memory Access(RDMA)がサポートされ、「CPUとオペレーティングシステムのオーバーヘッドの大半を避けながら」、あるマシンのメモリから別のマシンのメモリへデータを直接移動します。2 通信バックエンド。JACCLは「Appleが構築したオープンソースの集合通信ライブラリ」で、Thunderbolt上のRDMAで動作し、トランスポートを自分で管理することなく集合プリミティブを提供します。これは「機械学習に限定されず」「MLXなしでも構築でき」、あらゆる分散ワークロード向けにC++ APIを公開しています。2 MLXはその上に乗り、クラスタ全体の低レイテンシな協調にJACCLを使います。

Tatianaは4台のM3 Ultraからクラスタを構築しました。トポロジーが重要なのは、通信時間がレイテンシ(操作ごとの固定コスト)とトランスファー時間(メッセージサイズとともに増大する)に分かれるからです。JACCLは、最も低いレイテンシのために「すべてのマシンが他のすべてのマシンと直接つながる」メッシュと、各ノードが2つの隣接ノードとつながるリングをサポートします。リングでは、隣接ノードごとに複数のケーブルを引いて帯域幅を増やすためにポートが空きます。メッシュとして配線すると、JACCLは「メッセージサイズと通信操作に応じて最適なトポロジーを自動的に選び、レイテンシが重要なときはメッシュを、帯域幅が重要なときはリングを」選びます。2 設定でRDMAを有効にし、それからJSONのホストファイルを指すmlx.launchでジョブを起動します。ヘルパースクリプトmlx.distributed_configがそのホストファイルを生成し、--auto-setupを付ければThunderboltネットワーク自体も構成してくれます。2

クラスタ全体でモデルを実行するのは、1台のマシンで実行するのとほぼ同じです。同じmlx_lm.chatコマンドをmlx.launch --hostfileでラップするだけで、「MLX LMがモデルをシャーディングし、分散推論を協調してくれる」のです。2 並べて比較すると、270億パラメータのQwen 3.6は、4台のM3 Ultra上で「1台のマシンのほぼ3倍のレートで」トークンを生成しました。2 MLXは2つのシャーディング戦略をサポートします。パイプライン並列(深さで分割、通信は単純だが高速化はなし)と、テンソル並列(幅で分割、すべてのマシンが同じトークンを同時に処理して高速化するが、レイヤーごとに頻繁な通信が発生し、それが「メッシュトポロジーが不可欠な理由」となる)です。2 テンソル並列がデフォルトです。セッションでは、1兆パラメータのKimi 2.6(8ビットで約1テラバイトの重みがあり、「1台のM3 Ultraには収まらないが、4台にわたれば収まる」)をクラスタ全体で実行しました。2 同じアプローチはファインチューニングも高速化します。mlx_lm.loraによるデータ並列のLoRAトレーニングは、1台のM3 Ultraの毎秒約180トークンを、クラスタ上では毎秒約600トークンへと「3倍超の高速化」をもたらしました。2 MLXは、分散ワークフローをアプリに組み込むために、Python、Swift、C++を通じて同じプリミティブを公開しています。

ループをセキュアにする(セッション347)

Watch on Apple Developer ↗

Willyが4:01から間接プロンプトインジェクションを紹介し、Akshayが11:55からフレームワークAPIを取り上げます。

モデルにツールを呼び出す能力を与えることは、1つの扉を開けることになります。Willyはこう表現しました。「LLMは、強力でありながら騙されるリスクを抱えた、新しい確率的エンジンをあなたのアプリケーションの中に持ち込む」3 新しいリスクは間接プロンプトインジェクションであり、セッションはこれを「制御フローを乗っ取る意図をもって、モデルに提供された追加コンテキストに埋め込まれた指示」と定義しています。3 セッションの例題アプリLoose Leafには、カレンダーと友人のフィードを読み取り、お茶を注文できる「ティーパーティを企画する」機能があります。攻撃はこうです。ユーザーが自分のカレンダーを添えてパーティの計画を依頼すると、カレンダーのイベントには、代わりに機密のユーザーデータを削除するようモデルに指示する、仕込まれた命令が含まれています。3

インジェクションは2つの効果を生みます。データポイズニングは「実行されるアクションのパラメータに攻撃者が影響を与えること」で、母親宛てのメッセージを攻撃者宛てに変えてしまいます。アクションポイズニングは、攻撃者が「どのアクションを実行するかに影響を与える」もので、このメールを要約せよという要求を、メールを添えて悪意あるURLを開く方向へ誘導します。3 セッションはその危険を、Simon Willisonの「致命的な三要素(Lethal Trifecta)」に根ざして説明します。ユーザーが最もリスクにさらされるのは、エージェントシステムがプライベートデータへのアクセス、信頼できないコンテンツへの曝露、外部と通信する能力を組み合わせたときであり、これは「副作用を伴うあらゆるアクションのリスク」へと一般化されます。3 その枠組みは正直です。「間接プロンプトインジェクションの解決は、活発な研究領域である」のであり、だから現実的な目標は、自分のアプリのリスクを理解し、それを緩和することなのです。3

その手法は、脅威モデリングの演習です。まず、プロンプトに供給されるすべてのもののデータフロー分析を行い、「外部のエンティティから来るあらゆる入力」を信頼できないものとして印を付けます。Loose Leafの場合、それはカレンダーの内容と友人のフィードを意味します。3 次に、エージェントのアクションとその副作用の棚卸しをします。お茶を注文するツールは金銭的リスクを伴い、フィードに投稿するツールはデータ流出のリスクを伴い、一見無害な抽出タイマーでさえもリスクがあります。なぜなら、そのオプションのラベルが「プロンプトインジェクションに、後の攻撃のためのさらなる指示を書き込ませる余地を与えうる」からです。3 Appleが表明する好みは、「決定論的な緩和策をベースラインとして重視する。そのセキュリティ保証は監査しやすく、論理的に検討しやすいからだ」というもので、その上に確率的な緩和策を重ねます。3

それからAkshayがAPIを示しました。Foundation Modelsにおいて、ライフサイクルイベント修飾子は「セッション実行の特定のライフサイクルポイントで決定論的に発火するコールバック」であり、セキュリティのチェックポイントとして使えます。.onToolCall修飾子はエグゼキューターがツールを実行する前に走り、「このコールバックがエラーをスローすれば、そのツールは決して実行されない」ため、「確認を強制するのに最適な場所」となります。現在のツールが金銭関連のものかどうかを確認し、そうであればまずユーザーの確認を求めるのです。3 .historyTransform修飾子は「推論のためにトランスクリプトがモデルにレンダリングされる前に発火」し、信頼できないツール出力をスポットライトのデリミタで包み、機密のセグメントを[REDACTED]のプレースホルダに置き換えることで、モデルがそれを見る前にPIIを伏せられます。3 1つ注意点があります。これらの変換は「現在の推論イテレーションのみにスコープされる」ため、呼び出しごとに再適用するか、あるいは永続させたい変換には@SessionPropertyアノテーションを使います。3

App Intentsを通じてSiriと統合するアプリには、2つのシステムガードレールが適用されます。確認は「リスクベース」かつ「コンテキスト依存」です。インテントがスキーマを採用すると、そのスキーマのリスクメタデータを継承し(写真の削除は破壊的、データの流出はリスクが高い)、Risk Evaluationシステムはその静的なメタデータと「システムの動的な状態」を組み合わせて、実行前にユーザーに尋ねるかどうかを判断します。3 2つ目はロック画面認証です。Siriはロックされたデバイスでも到達可能なので、インテントのauthenticationPolicy.requiresAuthenticationに設定して、ロック中は破壊的なアクションが走らないようにします。スキーマのデフォルトポリシーは「より厳しくする方向にのみ」上書きでき、弱める上書きはビルドエラーになります。3

ループをデバッグする(セッション243)

Watch on Apple Developer ↗

Erikが、1:58から自身のCraftアプリでサイレントなエージェント障害を診断します。

ループの柔軟性は、同時にそのデバッグ上の問題でもあります。AI Tools EngineerのErikはこう述べました。「従来のコードは予測可能だ。LLMは非決定論的で、同じ入力が異なる出力を生みうる」4 彼は、従来の開発には存在しない3つの課題を挙げました。確率的な出力(だから「標準的なユニットテストは破綻し」、代わりに品質と意図を評価する)、モデル間の通信、そして観測可能性です。「マルチモデルのパイプラインで何かが壊れたとき、どこで間違ったのかを知るのは非常に難しい」4 Xcode 27のFoundation Models Instrumentは、まさにその最後の課題に答えるために存在します。

Erikは自身のCraftアプリで実演しました。そこではブレインストーミング機能が2つの命令セット、ブレインストーミングとチュートリアル生成を使い、ブレインストーミングのセットはGenerateCraftIdeaToolSwitchToTutorialModeToolを提供します。4 そのトレースでは、機能が失敗していました。チュートリアルに切り替わるべきところで、ひたすらアイデアを出し続けていたのです。Instructionsレーンがすぐにその顛末を物語りました。「セッション全体で1つの命令セットしかアクティブでなかったが、機能は2つを使うはずだった。つまり引き継ぎの途中で何かがおかしくなった」4 すべてを「セッション、リクエスト、モデル推論、命令、プロンプト、応答」へと整理するツリービューが、根本原因を浮かび上がらせました。「プロンプトはswitchToTutorialModeツールを参照しているが、そのツールはこの命令には実際には構成されていない」4 モデルはエラーをスローすることなくツール呼び出しを続けていました。「これはサイレント障害だった」のであり、最も捕まえにくい種類です。4 欠けていたツールをツールセットに追加するとそれは直り、再トレースでは2つの異なる命令セットがアクティブになり、switchToTutorialModeツール呼び出しのあとで引き継ぎが正しく起きていました。4

このInstrumentは、パフォーマンスも読み解けるようにします。Model Inferenceレーンは、入力プロンプトの処理に黄色のバーを、応答生成にオレンジのバーを使います。4 最適化を動かすメトリクスは3つあります。Time to First Token(「高いTime to First Tokenは、人々が空白の画面を見つめていることを意味する。これを減らすには、プロンプトを短くする」)、Tokens per Second(「異なるプロンプト構成にわたってパフォーマンスをベンチマークし、変更後のリグレッションを捉える」ため)、そしてTotal Latency(「人々が最も直接的に感じる数値」で、部分的な結果をより早くストリーミングすることで体感上は短縮される)です。4 運用上の注意が1つあります。このInstrumentは「あなたのデバイスからプロンプトと応答のデータを取得し、それには機密情報が含まれうる」ため、本番ではロギングはオフですがトレースの間だけオンになり、トレースファイルは安全な場所に保管します。4

どう始めるか

4つのセッションは、すでにあなたが所有しているハードウェアで実行できる一連の流れに組み合わさります。

  1. ローカルループを立ち上げる。 MLX-LMをpip installし、まずはセットアップを検証するために小さなツール呼び出し対応のモデルでmlx_lm.serverを実行し、エージェントのベースURLをlocalhostに向けます。エージェントにファイルを書かせたりビルドを走らせたりする前に、まずは読み取って報告するタスクから始めましょう。1 いざ書き込ませる段になったら、その作業を行う隔離された場所を与えます。container machinesは、エージェントにMac上の高速で永続的なLinux環境を与えます。VMで隔離され、ホームディレクトリがマウントされているため、ビルドやインストールはホストに対してではなく、本物の境界の内側で実行されます。
  2. 1台のMacで足りないときだけスケールする。 モデルがメモリに収まらない、あるいは推論が遅すぎる場合は、MacどうしをThunderbolt 5でつなぎ、設定でRDMAを有効にし、mlx.distributed_configでホストファイルを生成し、同じコマンドをmlx.launchの下で実行します。速度のためにはテンソル並列(デフォルト)を、それが必要とする低レイテンシのためにはメッシュトポロジーを選びましょう。2
  3. エージェント機能を出荷する前に脅威モデリングする。 信頼できないコンテキストの供給源と、すべてのアクションの副作用を残らず挙げます。副作用のあるツールには.onToolCallの確認を、信頼できないツール出力には.historyTransformのスポットライトと伏せ字を加えます。App Intentsについては、各インテントのリスクメタデータを見直し、破壊的なアクションがロック解除されたデバイスを要するようauthenticationPolicyを設定します。3
  4. 信頼する前にプロファイリングする。 Xcode 27のInstrumentでFoundation Models機能をプロファイリングし、InstructionsとModel Inferenceのレーンからサイレント障害を読み取り、Time to First Token、Tokens per Second、Total Latencyを使って遅いステップを見つけます。4

セッション232の内容はすべて「オープンソースで、いますぐ利用できる」のです。1

FAQ

本当にAIエージェントを丸ごとMac上で動かせますか?

はい。WWDC 2026のセッション232は、MLXを通じてエージェントのループ全体がローカルで動く様子を実演しています。モデルが推論し、ツールを呼び出し、結果を観察し、反復し、本当にネットワークを必要とするツール呼び出しだけがマシンの外へ出ます。スタックはMLX、MLX-LM、OpenAI互換のMLX-LM Server、そしてその上にOpenAIのchat completionsプロトコルを話す任意のエージェントです。1

エージェントをローカルのMLXモデルにどうつなげますか?

3ステップです。MLX-LMをpipでインストールし、ツール呼び出しに対応するモデルでmlx_lm.serverを起動し、エージェントフレームワークのベースURLをlocalhost上のローカルサーバーのアドレスに設定します。エージェントはこのローカルサーバーを、クラウドのLLM APIとまったく同じように扱います。MLX-LM Serverがドロップイン可能なOpenAI互換のHTTPサーバーだからです。1

モデルが1台のMacには大きすぎる場合はどうしますか?

MLXは、Thunderbolt 5でつながった複数のMacにモデルを分散します。RDMA(macOS 26.2からサポート)とAppleのオープンソース通信ライブラリJACCLを使います。mlx.launchとホストファイルでジョブを起動すれば、MLXがモデルを自動的にシャーディングします。Appleのセッションでは、1兆パラメータのモデルを4台のM3 Ultraにわたって実行し、推論とファインチューニングで単一マシンに対しおよそ3倍の高速化を確認しました。2

エージェント対応のMacアプリにとって、主な新しいセキュリティリスクは何ですか?

間接プロンプトインジェクションです。信頼できないコンテキスト(カレンダーのイベント、ソーシャルフィード、ツールの結果)に隠された悪意ある指示が、ユーザーが決して頼んでいないアクション、たとえばデータの削除や流出へとモデルを誘導します。Appleは、脅威モデリングのパスに加えて決定論的なガードレールを推奨しています。Foundation Modelsの.onToolCallによる確認と.historyTransformによるスポットライトおよびPIIの伏せ字、そしてApp Intentsのリスクベースの確認とロック画面認証です。3

サイレントに失敗するエージェントをどうデバッグしますか?

Xcode 27のFoundation Models Instrumentを使います。これはすべてのモデル推論、命令セット、プロンプト、応答をタイムラインのレーンとツリービューに取り込むので、各ステップでどのツールが利用可能だったか、そしてどこで引き継ぎがおかしくなったかを、モデルが一度もエラーをスローしないときでさえ正確に見られます。さらにパフォーマンスチューニングのために、Time to First Token、Tokens per Second、Total Latencyも提示します。4


Apple silicon上で自分のモデルを動かすことは、このループが立つ基盤です。MLX on Apple Silicon:Appleのではなく自分のモデルが必要なときと、Core AIでApple silicon上にモデルを動かすをご覧ください。エージェントがSwiftアプリにどう触れるかを形づくる、ランタイムとツーリングの区別はFoundation Modelsのエージェントワークフローにあります。ループが動いたら、その品質を測ることが次のステップで、AppleのEvaluationsフレームワークで取り上げています。シリーズ全体のハブはApple Ecosystem Seriesで、より広い構築の文脈はiOS Agent Development guideです。

References


  1. Apple, WWDC 2026 session 232, Run local agentic AI on the Mac using MLX. Source for the four-layer stack (MLX, MLX-LM, MLX-LM Server, agent), the three-step setup (pip install, mlx_lm.server, base-URL config), the agentic loop definition, the PR-summary and SwiftUI drawing-app demos, the Xcode Intelligence-tab integration, and the three hardware challenges: prompt processing (M5 Neural Accelerators, four-times-faster matrix multiplication versus M4), concurrency (continuous batching), and model size (the 1.6-trillion-parameter DeepSeek model requiring more than 800GB for weights). 

  2. Apple, WWDC 2026 session 233, Explore distributed inference and training with MLX. Source for RDMA over Thunderbolt 5 (macOS 26.2), the JACCL collective communication library, mesh-versus-ring topology, the mlx.launch / mlx.distributed_config workflow and JSON hostfile, tensor- versus pipeline-parallelism, the four-M3-Ultra cluster results (Qwen 3.6 at nearly three times single-machine token rate; one-trillion-parameter Kimi 2.6 running across four machines; LoRA fine-tuning from ~180 to ~600 tokens per second), and the Python, Swift, and C++ APIs. 

  3. Apple, WWDC 2026 session 347, Secure your app: mitigate risks to agentic features. Source for indirect prompt injection, data poisoning and action poisoning, the Lethal Trifecta framing, the threat-modeling exercise (untrusted context sources and action side effects), and the mitigation APIs: Foundation Models lifecycle event modifiers .onToolCall (confirmations) and .historyTransform (spotlighting and PII redaction, scoped to one inference iteration, with @SessionProperty for persistence), and App Intents risk-based contextual confirmations and authenticationPolicy (.requiresAuthentication, overridable only to a stricter policy). 

  4. Apple, WWDC 2026 session 243, Debug and profile agentic app experiences with Instruments. Source for the three LLM-development challenges (probabilistic output, model-to-model communication, observability), the Foundation Models Instrument in Xcode 27 (Instructions and Model Inference lanes, the session/request/inference tree view), the silent-failure diagnosis in the Craft app (a tool referenced in the prompt but missing from the instruction’s toolset), the privacy note on trace logging, and the three performance metrics: Time to First Token, Tokens per Second, and Total Latency. 

関連記事

Pythonから使うFoundation Models:fm CLI

macOS 27にはfmコマンドラインツールとPython向けのFoundation Models SDKが付属し、Appleのオンデバイスモデルをスクリプト化して評価パイプラインを構築できます。

2 分で読める

Game Porting Toolkit 4:Mac上でのエージェント型ゲーム移植

Game Porting Toolkit 4は、エージェント型の移植スキルをClaude Codeプラグインとして、さらにgpucaptureとgpudebugのCLIツールを提供します。Cyberpunkの手動移植が基準を打ち立てました。

2 分で読める

クリーンアップレイヤーこそが本当のAIエージェント市場である

Charlie Labsはエージェント構築から、エージェントの後始末をする側へとピボットしました。AIエージェント市場は生成から証明へと移行しています。クリーンアップこそが永続的なレイヤーなのです。

2 分で読める