ここ2年ほど、スマートフォンの発表会では決まってAIが主役だった。写真から通行人を消す。録音内容を要約する。質問に答える。機能は増え続けているが、使う側にはまだ一つの壁がある。AIが答えを出したあと、実際にアプリを開き、情報を入力し、画面を切り替えるのは、多くの場合まだ人間だ。
nubia NaviX Ultraが越えようとしているのは、まさにその壁である。
nubiaが「世界初のAIエージェントスマートフォン」と位置づけるこの新製品では、AIはもはやシステム内のチャットボックスにとどまらない。「明日の朝、上海へ行く高速鉄道のチケットを予約して」と頼むことも、まずFeishuで資料を探して要約し、その後で別の用件を処理させることもできる。タスクの実行中も、ユーザーは端末を通常どおり操作可能だ。画面をロックしても、タスクがただちに止まるわけではない。
今回の発表で新しいのは、AIへの入口がいくつ増えたかではない。nubiaが初めて「理解・操作・記憶・認証」を一本の流れとしてつないだ点にある。

「やり方を教える」から「そのまま代行する」へ
そのスマートフォンが本当にエージェント端末なのか。見極め方はシンプルだ。曖昧な日常語を、実行可能な一連の操作へ変換できるかどうかである。
発表会では、その仕組みが段階に分けて説明された。まず豆包スマホアシスタントがユーザーの意図を読み取り、タスクの目的を明確にしたうえで、複雑な依頼を複数のサブタスクへ分解する。初めて使うアプリや見慣れない画面に遭遇すると、画面上の要素を認識し、実行できる経路を探す。途中で操作が想定から外れれば、別の方法へ動的に切り替え、必要な場合はユーザーに操作を戻す。

これは、従来の固定コマンド型とは考え方が異なる。従来型の音声アシスタントは、拡張され続ける命令一覧に近い。「ライトをつける」「アラームを設定する」といった指示に対して、どの機能を呼び出すかをシステムがあらかじめ把握している。
一方、AIエージェントが扱うのは、十数分にわたり複数のアプリを横断する長いタスクかもしれない。発表会では、アプリ横断操作、100ステップを超える連続実行、長いコンテキストの保持、さらに処理中も目標を達成できたか継続的に確認する能力が示された。
すべてのサードパーティーアプリに、AI専用の対応機能を事前実装させる必要はない。許可された範囲では、マルチモーダルモデルがアプリ画面を認識し、そのまま操作する。システムアプリや一部の提携サービスについては、より深いレベルのインターフェースを通じてタスクを直接処理する。前者は対応範囲を広げ、後者は安定性を高める。二つの経路を併用するほうが、実際のスマートフォン環境には適している。

既存のレビューには、この違いがよく分かる例がある。Weiboで特定のデジタル系ブロガーが当日投稿した内容を探し、メモに整理するよう端末へ指示するというものだ。命令を受けると、AIが検索、閲覧、要約まで自力で進め、最後に再編集できる形で結果を提出した。
ユーザーの役割は、AIの案内どおりに一つずつ画面をタップすることではない。AIが仕上げてきた成果物を確認することへ変わる。
最大の進化は、AIの作業中にもスマートフォンを使えること
スマートフォン上のAIエージェントには、見過ごされがちな矛盾がある。AIが画面を操作したい一方で、ユーザーも同じ画面を使いたいという問題だ。
多くのスマートフォンアシスタントは、タスクを始めたあとにユーザーがホーム画面へ戻ったり、別のアプリを開いたりすると処理が中断してしまう。仕事を代行しているように見えて、実際には端末全体を占有している。
NaviX Ultraは、タスクをバックグラウンドへ移すことでこの問題に対処した。AIが操作を始めると、進行状況は画面上部のステータス領域に収められる。その間も、ユーザーはメッセージを送ったり、情報を閲覧したり、別の作業を進めたりできる。画面をロックしてもタスクは自動終了せず、人による確認が必要になった時点でシステムが操作権を戻す。

画像生成のような派手さはない。しかし、エージェント機能が日常的に使われるかどうかを左右する重要な分岐点だ。AIが一手ずつ操作する様子を見張る必要はなく、その作業のために自分の用事を中断する必要もない。スマートフォン上に、ユーザー用とAIエージェント用、二つの操作ラインが並行して走ることになる。
NaviX Ultraはタスクのキューイングにも対応する。レビューでは、最初にFeishu Minutesを開くよう頼んだあと、さらにチケット購入を追加していた。システムは二つの依頼を記録し、順番に実行する。後から追加したタスクのほうが緊急なら、進行中の処理を中断して優先順位を変更することも可能だ。複数の用件を一度に伝え、あとは端末自身に順番を組ませる。ここまで来ると、ようやく「携帯できるアシスタント」らしくなる。
やり取りも、できるだけ自然な話し方に寄せている。完璧な命令文を頭の中で組み立ててから話す必要はない。考えながら話し、途中で条件を足したり、要望を修正したりできる。
発表会では「ワークタスクモード」も披露された。一言の指示からコード、文書、表、プレゼンテーション資料を生成し、Coding、Doc、Excel、PPTといった一般的な生産性用途をカバーする。PC上の本格的なワークフローを置き換えられるとは限らないが、その場で小さなWebツールを作ったり、資料をまとめたりする用途には、はっきりとした実用価値がある。

AIを呼び出す前に、操作方法を選ばせない
入口が奥深くに隠れたスマートアシスタントは、なかなか日常の習慣にならない。そこでNaviX Ultraは、本体側面の専用AIボタン、音声ウェイクアップ、端末へ近づいて話す方法、連携するエコシステム機器という4種類の入口を用意した。
なかでも、端末へ近づいて話す操作は、人同士の会話に近い。機能を有効にしたあと、スマートフォンを口元へ持っていき、そのまま要件を話せばよい。決まったウェイクワードを先に唱える必要はない。
端末にはSeed全二重音声大規模モデルが導入され、連続した会話と、会話途中での割り込みに対応する。nubiaの研究所が公表したデータによれば、人の声が混じる騒音環境において、ウェイクアップ率は比較対象製品を48%、発話認識の正確性は21%上回り、10種類以上の方言もサポートするという。実際の性能は環境や話者のアクセントに左右されるものの、狙いは明快だ。話しかけるまでのハードルを下げてこそ、AIは頻繁に使われる入口になり得る。

側面に配置されたオレンジ色のAIボタンには、もう一つ役割がある。指紋認証も統合されているのだ。ボタンを押す行為は、アシスタントを起動するだけでなく、「いま話しているのは端末の所有者だ」とシステムへ伝えることにもなる。
AIがスケジュール、連絡先、過去の会話、個人の好みへアクセスするようになれば、この本人確認は付加的な便利機能ではない。安心して使うための前提条件になる。
スマートフォンが記憶を持ってこそ、本当にユーザーを理解できる
AIエージェントが人に代わって用事をこなすには、操作できるだけでは足りない。ユーザーが窓側と通路側のどちらを好むのか、前回保存したレストランはどこだったのかを覚え、端末内に散在する文書、録音、チャット履歴から答えを見つけ出す必要がある。
NaviX Ultraの仕組みは、3層に分かれている。
第1層は、能動的な記録だ。行ってみたいレストランを見つけたら、「覚えておいて」と一言伝えるだけで、その情報が記憶へ保存される。次に「この前の店はどこだった?」と尋ねれば記録を呼び出し、続けてナビゲーションを開始できる。
第2層は、好みの学習である。ユーザーの確認を経たうえで、よく使う設定や操作習慣をシステムが徐々に記憶し、同種のタスクで確認する回数を減らしていく。
第3層は、端末内データの検索だ。ユーザーが自ら機能を有効にして権限を与えると、文書、連絡先、SMS、アラームなど、スマートフォン内の情報を自然言語で探せる。目的の内容がどのアプリに保存されているのか、先に思い出す必要はない。

録音も、この記憶システムへ組み込まれている。リアルタイム文字起こし、話者の識別、構造化された要約、マインドマップ生成に対応し、Feishu Minutesとも連携する。
会議、取材、授業の機会が多い人にとっては、録音ボタンが一つ増えるよりもはるかに有用だ。音声を残すのは第一歩にすぎない。その内容を検索し、引用し、後の作業へ引き継げて初めて、個人のナレッジベースに入ったといえる。
記憶する情報が増えれば、当然リスクも高まる。nubiaはこの点を避けていない。ロック画面では、アシスタントに対し、オンラインでの質問応答、簡単なコマンドの実行、記憶データへのアクセス、端末操作、会話履歴の読み取りを許可するかどうかを、それぞれ個別に設定できる。個人情報が関係する場合は、AIボタンの指紋認証によって本人確認を行い、所有者以外には制限された回答だけを返す。

発表会では、SAEPエコシステムプロトコルも公表された。アプリのアクセス方針に関する宣言、ユーザーによる権限管理、全処理経路の監査をセキュリティ体系へ組み込み、ISO 27001、ISO 27701、ISO/IEC 42001などのマネジメントシステム認証も示された。
AIエージェントスマートフォンの安全性は、「データは保護されている」という一言で済ませるべきではない。何にアクセスしたのか、なぜアクセスしたのか、権限をどう取り消せるのかが、ユーザーから見える必要がある。

AIはカメラのファインダーにも入る
nubiaは、AIエージェントの能力を仕事や生活サービスだけに限定していない。NaviX Ultraの「AIイメージングマスター」には、インスピレーションキャプチャ、音声撮影ガイド、ワンフレーズ画像変換、AI音声レタッチが用意されている。
撮影時には、「もう少し近づいて」「2倍の焦点距離に切り替えて」といった要望をそのまま口にすれば、音声で構図や撮影を案内してくれる。撮影後も、自然言語による不要物の削除、画像の拡張、鮮明度の向上などの編集が可能だ。「ワンフレーズ画像変換」では、生成AIを使って写真の内容そのものを調整できる。
AI機能を何階層ものメニュー内に埋め込むより、撮影中に手がふさがりがちな実情に合った設計といえる。

AIエージェントを離れて見ても、フラッグシップスマートフォンだ
NaviX Ultraで最も目を引くのはAIだ。しかし、バックグラウンドで長時間タスクを処理する端末だからこそ、最終的にはハードウェアの基礎体力がものをいう。
前面には6.78インチのフラットディスプレイを搭載する。四辺のベゼル幅は約1.09mmで、1〜144HzのLTPO 2.0アダプティブリフレッシュレートと、最大輝度4500nitに対応する。フラットな画面、大きなR形状のコーナー、四辺均等の極細ベゼルにより、端末全体はすっきりした印象だ。背面には横方向に貫くカメラモジュールを置き、3分割の構成を採用。オレンジ色のAIボタンが、外観上の最も目立つアクセントになっている。

主要スペックについて、レビュー資料ではSnapdragon 8 Elite Gen 5を搭載するとされている。生体認証は、画面内蔵3D超音波指紋センサーと、側面AIボタンの指紋センサーという2系統だ。
背面カメラは、2億画素のメインカメラ、5000万画素の超広角カメラ、6400万画素のペリスコープ望遠カメラで構成される。7100mAhのバッテリーに、90W有線充電と50Wワイヤレス充電を組み合わせた。常時接続、画面認識、アプリをまたぐ操作といった高負荷な処理へ余力を持たせるための構成でもある。
価格は、12GB+512GBモデルが5,999元、16GB+512GBモデルが6,499元、16GB+1TBモデルが7,499元。発表会で示された中国の国家補助適用後価格は、5,499元からとなる。
「世界初」は出発点にすぎない。次に問われるのは、正しく動き続けられるか
NaviX Ultraの価値は、音声アシスタントを流行の名称で呼び直したことではない。AIをスマートフォンの操作フローへ本格的に組み込んだことにある。目的を理解し、複数のアプリを横断して実行し、バックグラウンドでも処理を続け、個人の記憶を参照する。そして、その実行権限に対応した認証の仕組みも備える。
もちろん、発表会での滑らかなデモが、あらゆる場面ですでに完成していることを意味するわけではない。サードパーティーアプリの更新後も画面を認識できるのか。数十ステップに及ぶタスクの成功率はどれほどか。決済やメッセージ送信など、リスクの高い操作では処理を止めて確認するのか。ネットワークが不安定になったあと、中断地点から再開できるのか。こうした点は、より長期間かつ複雑な日常利用のなかで検証する必要がある。
アプリのエコシステムが開かれているほど、エージェントに任せられることは増える。一方で、権限の境界が明確であってこそ、ユーザーは安心して用事を預けられる。
それでも、nubiaが問いを一歩先へ進めたことは確かだ。これまで私たちは「スマートフォンのAIは何に答えられるのか」と尋ねてきた。NaviX Ultraの登場によって、その問いは「この用事を、スマートフォンが最後まで代わりに済ませられるか」へ変わりつつある。

注:本文に記載した製品機能、研究所データ、仕様、価格は、発表会の画像および現時点のレビュー資料をもとに整理したものです。実際の機能、対応アプリ、効果については、量産版の仕様を基準としてください。
