기기 내 휴대폰 에이전트는 요청을 해석하고 맥락을 유지하며 도구를 선택할 수 있다. 앱의 응답을 기다렸다가 결과를 살핀 뒤 다음 단계를 정하기도 한다. 이 순환 과정에서는 제한된 메모리, 배터리, 발열 조건 안에서 모델 데이터를 반복해 옮기고 트랜스포머 연산을 수행하며 소프트웨어를 조율한다.
따라서 기기 내 에이전트형 AI는 TOPS 경쟁이 아니라 시스템 설계의 문제다. Qualcomm의 차세대 Hexagon NPU는 좋은 사례다. 발표된 변화가 트랜스포머 연산, 공유 메모리, 희소 모델 라우팅, 수치 정밀도, CPU 협업에 초점을 맞추기 때문이다. 다만 이런 기능만으로 미래의 휴대폰이나 에이전트가 뛰어나다고 판단할 수는 없다.
제품 관점의 정의는 AI 에이전트 폰의 의미와 이 명칭이 보장하지 않는 것에서 확인할 수 있다. 기기 비교는 2026년 글로벌 AI 폰 종합 가이드를 참고하자.
짧은 답: 에이전트에는 균형 잡힌 파이프라인이 필요하다
로컬 에이전트에는 모델과 작업 데이터를 담을 메모리, 프로세서에 데이터를 공급할 대역폭, 효율적인 트랜스포머 연산, CPU 제어, 빠른 저장장치가 필요하다. 모델과 허용된 앱 동작을 연결하는 소프트웨어도 갖춰야 한다. 냉각과 전력 관리는 이 작업을 얼마나 오래 지속할 수 있는지 결정한다.
| 하드웨어 또는 소프트웨어 계층 | 기여하는 역할 | 확인할 사항 |
|---|---|---|
| NPU | 반복되는 신경망 및 트랜스포머 연산을 효율적으로 가속 | TOPS만이 아니라 지원 모델, 정밀도, 측정된 지연 시간 |
| 칩 내 공유 메모리 | 자주 재사용하는 작업 데이터를 연산 장치 가까이에 유지 | 절대 용량, 대역폭, 비교 기준 |
| 시스템 RAM 및 저장장치 | NPU에 상주하지 않는 모델 가중치, 맥락 캐시, 전문가 모듈 보관 | 운영체제 실행 후 가용 메모리, 저장장치 속도, 모델 크기 |
| CPU | 단계 예약, 작업 라우팅, 앱 로직 처리, 데이터 준비 | 혼합 워크로드에서 전체 작업의 지연 시간과 효율 |
| 운영체제, 런타임, 앱 | 모델, 도구, 권한, 확인 절차, 대체 경로 제공 | 출시된 기기에서 실제로 작동하는 동작 |
| 발열 및 배터리 시스템 | 짧은 시연이 아니라 반복 추론을 지속 | 장시간 성능, 발열, 에너지 사용량 |
1. 트랜스포머 가속은 비용이 큰 반복 연산을 줄인다
대부분의 언어 및 멀티모달 모델은 트랜스포머를 사용한다. 추론 과정에서는 입력을 처리하고 토큰을 생성하면서 행렬 곱셈, 정규화, 원소별 함수를 반복 수행한다. CPU도 처리할 수 있지만 전용 가속기는 흔한 연산 패턴을 더 높은 병렬성과 에너지 효율로 실행할 수 있다.
Qualcomm에 따르면 새로운 Hexagon 설계에는 트랜스포머 워크로드를 겨냥한 Element Accelerator가 추가된다. NPU의 스칼라, 벡터, 행렬 확장을 대체하는 것이 아니라 함께 작동한다. NPU를 작업장으로 생각해 보자. 행렬 장치는 크고 규칙적인 연산 묶음을 맡고, 다른 장치는 형태와 제어 방식이 다른 연산을 처리한다. 전용 작업대를 더하면 장치 사이의 전달이나 맞지 않는 장비를 비효율적으로 쓰는 일이 줄어들 수 있다.
이는 Qualcomm이 밝힌 아키텍처 주장이지 독립 벤치마크 결과가 아니다. 특정 모델의 작업 시간, 에너지 사용량, 시판 휴대폰의 지속 성능을 보여 주지는 않는다.
2. 데이터 이동도 일이므로 공유 메모리가 중요하다
NPU는 접근할 수 없는 데이터로 계산할 수 없다. 모델 가중치는 학습된 값이고, 활성값은 입력이 네트워크를 통과하면서 생기는 임시 출력이다. 중간 텐서와 모델 상태도 이후 연산에 쓰일 때까지 유지돼야 한다. 언어 모델은 앞선 토큰을 나타내는 맥락 캐시를 별도로 둘 수 있다. 이 모든 데이터가 제한된 메모리를 두고 경쟁한다.
Qualcomm에 따르면 차세대 Hexagon NPU의 공유 메모리 서브시스템은 50% 더 크다. 목표는 더 많은 모델 상태, 활성값, 중간 텐서를 칩 안에 유지해 외부 DDR 메모리 접근을 줄이는 것이다. 작업대가 넓어진 요리사를 떠올리면 쉽다. 자주 쓰는 재료를 손이 닿는 곳에 두어 단계마다 식료품 저장실에 다녀오는 시간과 에너지를 줄일 수 있다. 작업대가 넓어져도 저장실 자체가 커지는 것은 아니다.
이 비율에는 맥락이 필요하다. Qualcomm의 발표문에는 공유 메모리의 절대 용량이 나오지 않는다. 50% 증가가 휴대폰 전체 RAM이 50% 늘었다는 뜻도 아니다. 대형 모델 전체가 그 NPU 메모리에 들어간다는 의미도 아니다. 구매자와 개발자는 총 RAM, 가용 RAM, 메모리 대역폭, 저장장치 동작, 실제 워크로드 측정치를 여전히 확인해야 한다.
3. Mixture-of-Experts는 한 번에 실행되는 모델의 규모를 바꾼다
밀집 모델은 각 추론 단계에서 폭넓은 매개변수를 사용한다. 반면 Mixture-of-Experts(MoE) 모델은 전문화된 전문가 블록을 두고 각 토큰을 일부 블록으로 보낸다. Qualcomm은 매개변수 300억 개 규모의 MoE가 수백억 개의 매개변수를 사용 가능한 상태로 두되, NPU에서 토큰을 생성하는 각 단계에는 라우팅된 약 30억 개만 활성화하는 사례를 제시한다.
30개 진료과가 있는 병원에서 한 번의 진료에는 관련 전문의만 참여한다고 생각해 보자. 병원의 전체 전문성은 여전히 건물과 행정 지원을 필요로 하지만 실제 진료에는 일부만 투입된다. 마찬가지로 ‘약 30억 개 활성화’는 토큰당 연산량과 대역폭을 줄일 수 있다. 그러나 나머지 모델도 어딘가에 있어야 하며, 보통 저장장치와 메모리에 걸쳐 놓인다. 전문가를 라우팅하거나 불러오는 데도 비용이 든다.
Qualcomm은 플래시에서 메모리로 전문가 모듈을 옮겨 관리하고 캐시하는 방식을 설명한다. 더 큰 모델 계열을 휴대폰에서 실용적으로 만들 수 있지만, 30B MoE를 매 토큰마다 30B 밀집 모델을 실행하는 것과 같다고 표현해서는 안 된다. 이 사례만으로 출시 제품의 모델 품질, 토큰 속도, RAM 요구량, 배터리 수명도 알 수 없다.
4. 정밀도는 품질·메모리·속도에 관한 결정이다
정밀도는 추론 중 모델 값을 몇 비트로 표현하는지를 뜻한다. 비트 수가 낮은 형식은 보통 가중치 크기, 메모리 트래픽, 연산 비용을 줄인다. 하지만 모델과 런타임이 제대로 대응하지 못하면 과도한 양자화가 정확도를 떨어뜨릴 수 있다. 모든 경우에 가장 좋은 형식은 없다.
Qualcomm은 INT2, INT4, INT8, FP8, FP16 지원을 명시한다. 개발자는 압축에 강한 부분에는 더 작은 형식을 쓰고 품질이 중요한 부분에는 높은 정밀도를 유지할 수 있다. 하나의 전역 ‘고속 모드’ 스위치를 켜는 것보다 각 자산에 맞는 이미지 형식을 고르는 일에 가깝다.
또한 회사는 INT4 모델의 프리필 성능이 최대 50% 높다고 주장한다. 프리필은 응답을 생성하기 전에 프롬프트와 기존 맥락을 처리하는 단계다. 디코드는 이후 토큰을 하나씩 생성하는 단계다. 프리필이 빨라지면 특히 입력이 길 때 출력 전 대기 시간이 줄어들 수 있다. 그렇다고 에이전트 작업 전체가 자동으로 50% 빨라지는 것은 아니다. 공개된 수치는 공급업체의 주장이고 ‘최대’라는 단서가 붙는다. 해당 글에는 모델, 프롬프트 길이, 전력 수준, 비교 플랫폼도 제시되지 않았다. 디코드 속도, 도구 지연, 앱 간 전달이 여전히 전체 시간을 좌우할 수 있다.
5. CPU는 에이전트 순환 과정을 지휘한다
NPU는 모델 추론을 맡는 전문가이지 운영체제를 대신하지 않는다. 에이전트에는 여전히 제어 흐름이 필요하다. 어떤 모델이나 도구를 호출할지 결정하고, 입력을 준비하고, 작업을 예약하고, 작업 상태를 추적해야 한다. 지원되지 않는 연산을 처리하고 앱과 프로세서 사이에서 결과도 전달한다.
Qualcomm은 CPU가 여러 단계의 워크로드를 조율하고 NPU가 바로 쓸 수 있도록 데이터를 준비하는 보완적 역할을 한다고 설명한다. 오케스트라를 떠올려 보자. 타악기 파트가 빨라져도 다음에 무엇을 연주할지는 정해지지 않는다. 전체 반응성은 가장 빠른 파트뿐 아니라 지휘자, 악보, 파트 간 전달에도 달려 있다.
따라서 칩 역량과 제품 역량은 다르다. 휴대폰 제조사는 런타임, 운영체제 서비스, 앱 인터페이스, 권한을 통합해야 한다. 개발자는 지원되는 백엔드에 맞춰 최적화하고 시험해야 한다. CPU로의 대체 실행이나 빠진 앱 인터페이스 하나가 이론적인 NPU 우위를 무색하게 만들 수 있다.
더 나은 AI 하드웨어만으로 입증되지 않는 것
- 신뢰성: 추론이 빠르다고 모델이 요청을 이해하고 올바른 도구를 고르며 오류에서 복구한다는 뜻은 아니다.
- 실행 권한: 하드웨어는 메시지, 결제, 파일, 설정 접근 권한을 줄 수 없다. 운영체제, 앱, 사용자가 해당 동작을 허가해야 한다.
- 앱 지원: 앱 간 작업에는 지원되는 API, 프로토콜, 연동 기능이 필요하다. 성능 좋은 NPU도 쓸 수 있는 동작을 공개하지 않은 앱은 조작할 수 없다.
- 안전한 자율성: 민감한 동작에는 여전히 범위 제한, 투명한 미리보기, 확인, 기록, 취소, 대체 동작이 필요하다.
- 기본적으로 보장되는 개인정보 보호: 로컬 처리는 서버로 보내는 데이터를 줄일 수 있지만 원격 측정, 백업, 계정 동기화, 클라우드 대체 처리가 데이터를 기기 밖으로 옮길 수 있다.
- 지속 성능: 짧은 시연만으로 장시간 에이전트 세션의 발열, 배터리 소모, 속도를 알 수 없다.
Qualcomm은 적합한 추론을 클라우드에서 엣지로 옮기면 비용, 개인정보 보호, 성능, 개인화가 개선될 수 있다고 별도로 주장한다. 이는 가능한 설계상의 이점이지 보장된 결과가 아니다. 더 큰 모델, 최신 정보, 무거운 연산이 필요한 작업은 클라우드에 남을 수 있으며 실용적인 에이전트는 하이브리드 방식일 수 있다.
구매자 점검표: 실리콘 구호가 아니라 휴대폰을 평가하자
- 이름이 명시된 어떤 에이전트 작업을 현재 내 지역과 언어에서 쓸 수 있는가?
- 어떤 단계가 기기에서 완전히 실행되며 언제 클라우드를 사용하는가?
- 오프라인이거나 앱·계정·서비스를 쓸 수 없을 때 어떻게 되는가?
- 어떤 앱이 지원되는 동작을 제공하며 어떤 작업은 사용자가 직접 이어서 해야 하는가?
- 결과가 중대한 동작을 검토·승인·취소·감사할 수 있는가?
- 운영체제와 일반 앱 실행 후 RAM과 저장공간이 얼마나 남는가?
- 지연 시간, 배터리, 발열 결과를 시판 기기에서 장시간 사용해 측정했는가?
- 공급업체는 모델, 런타임, 보안, 연동을 얼마나 오래 업데이트하는가?
개발자 점검표: 전체 동작 순환을 시험하자
- 프리필, 디코드, 도구 호출, 앱 간 전달을 각각 프로파일링한다.
- 메모리, 대역폭, 에너지, 온도의 최대치와 지속 수치를 측정한다.
- 낮은 비트가 괜찮다고 가정하지 말고 정밀도별 품질을 검증한다.
- MoE 모델은 준비된 상태의 실행만 보지 말고 전문가 로딩과 캐시 미스도 시험한다.
- 어떤 연산이 NPU에서 실행되고 어떤 연산이 다른 장치로 넘어가는지 기록한다.
- 명시적인 권한 범위, 확인 절차, 시간 제한, 복구 경로를 설계한다.
- 출시되는 하드웨어와 소프트웨어에서 완전한 사용자 작업을 벤치마크한다.
자주 묻는 질문
기기 내 AI 에이전트에 NPU가 꼭 필요한가?
반드시 필요한 것은 아니다. CPU와 GPU도 AI 모델을 실행할 수 있다. NPU는 신경망 추론을 효율적으로 가속하도록 설계돼 배터리로 작동하며 반복되는 워크로드에 유리할 수 있다. 최종 사용 경험은 메모리, 소프트웨어, 앱 접근에도 달려 있다.
30B MoE라면 휴대폰이 300억 개 매개변수를 모두 계산한다는 뜻인가?
아니다. Qualcomm의 사례에서는 약 300억 개 매개변수를 사용 가능한 상태로 두지만 각 토큰 단계에는 약 30억 개를 라우팅한다. 전체 모델에는 여전히 저장공간과 메모리 관리가 필요하다. 일부만 라우팅한다고 3B 모델과 같아지는 것도 아니다.
공유 메모리가 50% 커지면 휴대폰 RAM도 50% 늘어나는가?
아니다. Qualcomm이 말하는 것은 전체 시스템 RAM이 아니라 NPU의 공유 메모리 서브시스템이다. 발표문은 상대적인 증가율을 제시하지만 절대 용량은 밝히지 않았다.
INT4 프리필이 빨라지면 에이전트도 50% 빨라지는가?
반드시 그렇지는 않다. Qualcomm은 조건이 명시되지 않은 한 추론 단계에서 최대 50% 높은 성능을 주장한다. 토큰 생성, CPU 조율, 네트워크 호출, 앱 응답 시간, 확인 단계도 작업 완료 시간에 영향을 준다.
고지 및 출처
이 글은 Qualcomm이 공개한 아키텍처 주장을 분석한다. 인용된 성능 수치는 Qualcomm의 주장으로, Meydo가 독립적으로 시험한 결과가 아니다. Meydo는 이 발표를 근거로 Meydo 제품의 기능을 주장하지 않는다.
