端末上で動くスマートフォンエージェントは、依頼を解釈し、コンテキストを保持し、ツールを選び、アプリの処理を待ち、結果を確認して、次に何をするか判断します。このループでは、限られたメモリ、バッテリー、放熱性能の中で、モデルデータの移動、Transformer演算、ソフトウェア間の連携が繰り返されます。
だからこそ、オンデバイスのエージェント型AIはTOPS値を競う話ではなく、システム設計の問題です。Qualcommの次世代Hexagon NPUは、その分かりやすい例です。発表された変更点は、Transformer演算、共有メモリ、スパースモデルのルーティング、数値精度、CPUとの協調を対象としています。ただし、こうした機能だけで将来のスマートフォンやエージェントの良し悪しが決まるわけではありません。
製品レベルの定義については、AIエージェントフォンとは何か、そしてその呼び名が何を保証しないかをご覧ください。端末を比較する場合は、2026年版・世界のAIスマートフォン総覧を参照してください。
要点:エージェントにはバランスの取れた処理系が必要
ローカルエージェントには、モデルと作業データを置くメモリ、プロセッサへデータを供給する帯域幅、効率のよいTransformer演算、CPUによる制御、高速ストレージ、そしてモデルと許可されたアプリ操作を結ぶソフトウェアが必要です。冷却と電力管理は、この処理をどれだけ長く継続できるかを左右します。
| ハードウェア/ソフトウェア層 | 担う役割 | 確認すべき点 |
|---|---|---|
| NPU | 反復するニューラルネットワーク演算とTransformer演算を効率よく高速化する | 対応モデル、数値精度、実測レイテンシ。TOPS値だけで判断しない |
| チップ内共有メモリ | 繰り返し使う作業データを演算器の近くに保持する | 絶対容量、帯域幅、比較の基準 |
| システムRAMとストレージ | モデルの重み、コンテキストキャッシュ、NPUに常駐しないエキスパートを保持する | OS起動後に使えるメモリ、ストレージ速度、モデルの容量 |
| CPU | 手順をスケジュールし、処理を振り分け、アプリロジックを扱い、データを準備する | 複合ワークロードでのタスク全体のレイテンシと効率 |
| OS、ランタイム、アプリ | モデル、ツール、権限、確認手順、代替処理を提供する | 市販端末で実際に動く操作 |
| 放熱・バッテリーシステム | 短いデモだけでなく、推論を繰り返し継続できるようにする | 長時間利用時の性能、発熱、消費電力 |
1. Transformerアクセラレーションが高コストな反復を減らす
言語モデルとマルチモーダルモデルの多くはTransformerを使います。推論では、入力の処理とトークン生成の間に、行列乗算、正規化、要素単位の関数を繰り返し適用します。CPUでも処理できますが、専用アクセラレーターなら一般的な演算パターンを、より高い並列性と電力効率で実行できます。
Qualcommによれば、新しいHexagonの設計には、Transformerワークロード向けのElement Acceleratorが追加されています。これはNPUのスカラー、ベクトル、行列の各拡張を置き換えるのではなく、連携して動作します。NPUを工房に例えると、行列演算器は規則的で大規模な計算をまとめて処理し、別の演算器は異なる形状や制御を要する処理を担当します。専用の作業台を加えれば、受け渡しや、適さない機械を非効率に使う場面を減らせます。
これはQualcommによるアーキテクチャ上の主張であり、独立したベンチマーク結果ではありません。特定モデルの処理時間、消費電力、市販スマートフォンでの持続性能を示すものでもありません。
2. データ移動も処理であるため、共有メモリが重要になる
NPUは、アクセスできないデータを使って計算できません。モデルの重みは学習された値であり、アクティベーションは入力がネットワークを通過するときに生じる一時的な出力です。中間テンソルやモデルの状態も、後続処理で使うまで保持する必要があります。言語モデルは、過去のトークンを表すコンテキストキャッシュを維持することもあります。これらが限られたメモリを取り合います。
Qualcommによれば、次世代Hexagon NPUの共有メモリサブシステムは50%拡大されています。より多くのモデル状態、アクティベーション、中間テンソルをチップ内に保持し、外部DDRメモリへのアクセスを減らす狙いです。大きな調理台を持つ料理人に例えられます。繰り返し使う材料を手元に置けるため、工程ごとに食品庫へ取りに行く待ち時間と移動のエネルギーを減らせます。調理台を広げても食品庫は大きくなりませんが、作業は効率化できます。
この割合は文脈とともに読む必要があります。Qualcommの記事は、今回の発表で共有メモリの絶対容量を示していません。50%拡大したのはスマートフォン全体のRAMではなく、NPUの共有メモリサブシステムです。また、大規模モデル全体がNPUメモリに収まるという意味でもありません。購入者と開発者は、総RAM、利用可能RAM、メモリ帯域幅、ストレージの挙動、実ワークロードでの測定値を引き続き確認する必要があります。
3. Mixture-of-Expertsは一度に動かすモデルの範囲を変える
密なモデルは、各推論ステップでパラメータの広い範囲を使います。一方、Mixture-of-Experts(MoE)モデルには専門化されたエキスパートブロックがあり、各トークンをその一部へ振り分けます。Qualcommは、300億パラメータのMoEで数百億のパラメータを利用可能な状態に保ちながら、NPU上での各トークン生成ステップでは、ルーティングされた約30億パラメータを有効にする例を示しています。
30の診療科がある病院で、一回の診察には関係する専門医だけが参加すると考えてみてください。病院全体の専門性には建物と運営が必要ですが、その症例に対応するのは一部です。同様に「約30億が有効」なら、トークンごとの演算量と帯域幅を抑えられます。ただし残りのモデルも、通常はストレージとメモリのどこかに置く必要があり、エキスパートのルーティングや読み込みにもオーバーヘッドがあります。
Qualcommは、この仕組みの一部としてフラッシュからメモリへのエキスパート管理とキャッシュを説明しています。より大規模なモデルをスマートフォンで実用化できる可能性はありますが、300億パラメータのMoEを、毎トークンで300億パラメータすべてを動かす密なモデルと同等に扱うべきではありません。この例だけでは、市販端末におけるモデル品質、トークン生成速度、必要RAM、バッテリー駆動時間も分かりません。
4. 数値精度は品質、メモリ、速度の選択
数値精度は、推論時にモデルの値を何ビットで表すかを示します。一般に低ビット形式は重みの容量、メモリ転送量、演算コストを減らせますが、モデルとランタイムが適切に対応しなければ、過度な量子化で精度が低下します。すべてに最適な形式はありません。
QualcommはINT2、INT4、INT8、FP8、FP16への対応を挙げています。この幅があれば、誤差に強い部分には小さな形式を割り当て、品質のために必要な部分には高い精度を残せます。一つの「高速モード」スイッチを全体に適用するというより、素材ごとに適切な画像形式を選ぶ考え方に近いものです。
同社はさらに、INT4モデルでプリフィル性能が最大50%向上すると主張しています。プリフィルは、回答を生成する前にモデルがプロンプトと既存のコンテキストを処理する段階で、デコードはその後にトークンを一つずつ生成する段階です。プリフィルが速くなれば、特に入力が長い場合に、出力開始までの待ち時間を短縮できる可能性があります。しかし、エージェントのタスク全体が自動的に50%速くなるわけではありません。公表値はベンダーによる「最大」の主張で、記事にはモデル、プロンプト長、電力レベル、比較対象のプラットフォームが示されていません。デコード速度、ツールの待ち時間、アプリ間の受け渡しが全体を左右することもあります。
5. CPUがエージェントのループを指揮する
NPUはモデル推論の専門処理装置であり、OSの代わりではありません。エージェントには、どのモデルやツールを呼び出すかの判断、入力の準備、処理のスケジューリング、タスク状態の追跡、未対応処理への対処、アプリやプロセッサ間での結果受け渡しといった制御フローが必要です。
QualcommはCPUを、複数ステップのワークロードを統括し、NPUがすぐ使えるようデータを整える補完的な存在として説明しています。オーケストラに例えると、打楽器奏者を速くしても、合奏で次に何を演奏するかは決まりません。端から端までの応答性は、最も速いパートだけでなく、指揮者、楽譜、受け渡しにも左右されます。
したがって、チップの能力と製品の能力は別物です。スマートフォンメーカーは、ランタイム、OSサービス、アプリインターフェース、権限を統合する必要があります。開発者は対応するバックエンド向けに最適化し、テストしなければなりません。CPUへのフォールバックや、アプリインターフェースの欠如によって、理論上のNPUの優位性が帳消しになることもあります。
AIハードウェアの向上だけでは証明できないこと
- 信頼性:推論が速くても、モデルが依頼を理解し、正しいツールを選び、エラーから復旧できるとは限りません。
- 操作の権限:ハードウェアはメッセージ、決済、ファイル、設定へのアクセス権を与えられません。OS、アプリ、ユーザーによる許可が必要です。
- アプリ対応:アプリをまたぐ処理には、対応するAPI、プロトコル、連携機能が必要です。高性能なNPUでも、利用可能な操作を公開していないアプリは動かせません。
- 安全な自律性:影響の大きい操作には、範囲制限、分かりやすいプレビュー、確認、ログ、キャンセル、代替動作が依然として必要です。
- 初期状態でのプライバシー:ローカル処理はサーバーへ送るデータを減らせますが、テレメトリ、バックアップ、アカウント同期、クラウドへのフォールバックでデータが端末外へ移る場合があります。
- 持続性能:短時間のデモでは、エージェントを長く利用した際の発熱、バッテリー消費、速度は分かりません。
Qualcommは別途、適切な推論をクラウドからエッジへ移すことで、コスト、プライバシー、性能、パーソナライズを改善できると主張しています。これらは設計上期待できる利点であり、保証された結果ではありません。より大きなモデル、最新情報、大規模な演算を必要とするタスクはクラウドに残る可能性があり、実用的なエージェントはハイブリッド型になることもあります。
購入者向けチェックリスト:シリコンの宣伝文句ではなく端末を評価する
- 名前が明示されたどのエージェント機能を、現在、自分の地域と言語で使えるか。
- どの手順が完全に端末上で動き、いつクラウドを使うのか。
- オフライン時や、アプリ、アカウント、サービスを利用できないときにどうなるか。
- どのアプリが対応操作を公開し、どの場面で手動の引き継ぎが必要か。
- 影響の大きい操作を確認、承認、キャンセル、監査できるか。
- OSと通常のアプリが使用した後に、RAMとストレージがどれだけ残るか。
- レイテンシ、バッテリー、温度の結果は、市販端末で継続利用を通じて測定されたものか。
- ベンダーはモデル、ランタイム、セキュリティ、連携機能をいつまで更新するか。
開発者向けチェックリスト:操作ループ全体をテストする
- プリフィル、デコード、ツール呼び出し、アプリ間の受け渡しを個別にプロファイルする。
- メモリ、帯域幅、エネルギー、温度のピーク値と持続値を測定する。
- 低ビットでも問題ないと決めつけず、数値精度ごとに品質を検証する。
- MoEモデルではウォーム状態だけでなく、エキスパートの読み込みとキャッシュミスもテストする。
- どの演算がNPUで実行され、どれが別の処理装置へフォールバックするか記録する。
- 明示的な権限範囲、確認手順、タイムアウト、復旧経路を設計する。
- 出荷版のハードウェアとソフトウェアで、ユーザーのタスク全体をベンチマークする。
よくある質問
オンデバイスAIエージェントにNPUは必須ですか?
厳密には必須ではありません。CPUやGPUでもAIモデルを実行できます。NPUはニューラルネットワーク推論を効率よく高速化するために設計されており、バッテリーで動き、処理を繰り返す用途では重要になることがあります。最終的な体験は、メモリ、ソフトウェア、アプリへのアクセスにも左右されます。
300億パラメータのMoEは、スマートフォンが300億すべてを計算するという意味ですか?
いいえ。Qualcommの例では、モデル全体として約300億パラメータを利用できますが、トークンごとのステップで振り分けられるのは約30億です。モデル全体を置くストレージとメモリ管理は必要であり、一部だけを振り分けても30億パラメータのモデルと同じにはなりません。
共有メモリが50%大きいと、スマートフォンのRAMも50%増えますか?
いいえ。Qualcommが説明しているのはNPUの共有メモリサブシステムであり、システムRAM全体ではありません。発表記事が示しているのは相対的な増加率で、絶対容量は記載されていません。
INT4のプリフィルが速くなると、エージェントも50%速くなりますか?
必ずしもそうではありません。Qualcommの主張は、条件が明示されていない中で、推論の一段階が最大50%高速になるというものです。トークン生成、CPUによる統括、ネットワーク呼び出し、アプリの応答時間、確認手順も、タスク完了までの時間を左右します。
開示事項と情報源
本稿はQualcommが公表したアーキテクチャ上の主張を分析したものです。記載した性能値はQualcommによる主張であり、Meydoが独自にテストした結果ではありません。Meydoは、これらの発表を根拠にMeydo製品の能力を主張していません。
