2026년 9월 29일 검토. 오랫동안 음성 비서는 세 개의 상자로 설명할 수 있었습니다. 음성 인식이 소리를 텍스트로 바꾸고, 언어 모델이 답할 내용을 결정한 뒤, 음성 합성이 답변을 다시 소리로 만듭니다. 흔히 ‘듣고, 생각하고, 말하기’라고 요약하는 순서입니다. 대화 기록, 엄격한 검증 또는 교체 가능한 구성 요소가 필요한 업무에서는 여전히 유용합니다. 하지만 이제 음성 AI의 유일한 유력 설계는 아닙니다.
새로운 시스템은 실시간 오디오를 직접 처리하고, 사용자의 발화가 완전히 끝나기 전에 작업을 시작하며, 말하는 동안에도 계속 들을 수 있습니다. 단순히 합성 음성이 빨라진 변화가 아닙니다. 오디오 파일이나 완료된 발화를 주고받는 방식에서 벗어나 침묵, 끼어들기, 강조, 배경음까지 포함한 연속적인 대화를 다루는 방향으로 옮겨가고 있습니다.
‘듣고, 생각하고, 말하기’ 음성 파이프라인이란?
전통적인 음성 AI 파이프라인은 대개 세 가지 핵심 단계로 이루어집니다.
- 듣기: 음성-텍스트 변환이라고도 하는 자동 음성 인식(ASR)이 사용자의 음성을 단어로 바꿉니다.
- 생각하기: 언어 모델이나 대화 시스템이 단어를 해석하고 필요하면 도구를 호출한 뒤 텍스트 답변을 만듭니다.
- 말하기: 텍스트-음성 변환(TTS)이 답변을 오디오로 합성합니다.
기본 구현에서는 각 단계가 앞 단계의 완료를 기다립니다. 이해하고 제어하기 쉬운 구조지만, 단계 사이의 경계마다 지연이나 정보 손실이 생길 수 있습니다. 최신 단계별 연결 시스템은 부분 결과를 다음 단계로 실시간 전달할 수 있으므로 ‘파이프라인’이 반드시 ‘느림’을 뜻하지는 않습니다. 진짜 차이는 듣기, 추론, 말하기 사이에서 텍스트가 반드시 거쳐야 하는 전달 형식인지에 있습니다.
세 단계 모델이 대화처럼 느껴지지 않는 이유
단계 사이에서 지연이 누적됩니다
음성 시스템은 침묵이 ‘말을 마쳤다’는 뜻인지, 아니면 단지 ‘생각 중이다’라는 뜻인지 판단해야 합니다. 너무 오래 기다리면 대화가 늘어지고, 너무 일찍 답하기 시작하면 사용자 말을 가로막습니다. 발화 종료 감지 이후에도 음성 인식, 모델 추론, 음성 합성, 네트워크 통신, 도구 호출이 각각 응답 시간의 일부를 차지합니다.
사람 사이의 대화 속도는 까다로운 비교 기준입니다. 2009년 10개 언어의 질문과 답변 순서를 연구한 결과, 반응 시간에는 언어 간 차이가 있지만 침묵과 발화 겹침을 최소화하려는 공통 경향이 나타났습니다. 그렇다고 모든 제품에 200밀리초 응답을 요구해야 하는 것은 아닙니다. 사람 사이의 대화는 고객 지원 전화나 통역, 느린 데이터베이스를 사용하는 음성 에이전트와 다릅니다. 다만 이유를 알 수 없는 침묵이 1초 더 이어지면 왜 쉽게 눈에 띄는지는 설명해 줍니다.
OpenAI가 2024년 GPT-4o를 발표하며 제시한 과거 사례도 비교에 도움이 됩니다. 이전 ChatGPT 음성 모드는 세 개의 별도 모델을 사용했고 평균 응답 시간은 GPT-3.5에서 2.8초, GPT-4에서 5.4초였습니다. 반면 종단 간 GPT-4o 모델은 오디오에 빠르면 232밀리초, 평균 320밀리초 만에 응답한다고 보고됐습니다. 이 수치는 당시 출시 및 시험 조건에 관한 것이지 모든 네트워크, 기기, 도구 사용 애플리케이션에서 보장되는 성능이 아닙니다. 아키텍처가 사용자 경험의 일부가 된 이유를 보여주는 사례입니다.
대화 기록은 음성을 압축해 담은 결과입니다
텍스트는 단어를 잘 담아내지만, 일반적인 대화 기록에서는 그 단어의 해석을 바꾸는 단서가 빠질 수 있습니다. 머뭇거림, 강세, 말의 속도, 웃음, 억양, 겹쳐 말하는 화자, 말이 아닌 소리 등이 그렇습니다. ‘괜찮아요’는 동의일 수도, 체념이나 짜증일 수도 있습니다. 다른 구성 요소가 이런 음향 단서를 보존하지 않는다면 텍스트만 다루는 추론 단계에는 세 경우 모두 같은 문장으로 들어올 수 있습니다.
그렇다고 모든 시스템이 감정을 추론해야 한다거나 목소리만으로 의도를 믿을 만하게 알아낼 수 있다는 뜻은 아닙니다. 감정 인식은 문화적 차이에 취약할 수 있고, 중요한 결정을 내리는 상황에서는 부적절할 수도 있습니다. 여기서 말하는 범위는 아키텍처에 한정됩니다. 오디오에는 일반 텍스트에 없는 정보가 담겨 있으므로 오디오를 버리는 설계는 나중에 그 정보를 활용할 수 없습니다.
대화는 발화를 깔끔하게 번갈아 주고받는 과정이 아닙니다
사람은 말을 끊거나 겹쳐 말하고, 문장을 다시 시작하며, ‘맞아요’, ‘음’, ‘그렇군요’처럼 짧게 호응합니다. 반이중 방식의 비서는 한 번에 한쪽만 활성 상태로 봅니다. 듣다가 듣기를 멈추고 말합니다. 전이중 방식은 오디오를 출력하면서도 사용자의 말을 계속 감지할 수 있어, 사용자가 말할 때 출력을 멈추거나 발언권을 넘기거나 답변을 조정할 수 있습니다.
이는 중단 버튼을 추가하는 것보다 어렵습니다. 시스템은 실제 끼어들기와 배경 대화 또는 가벼운 맞장구를 구분하고, 아직 재생되지 않은 오디오를 중단하며, 사용자가 실제로 들은 내용과 대화 상태를 일치시켜야 합니다. 2025년에 소개된 Full-Duplex-Bench는 기록된 텍스트나 답변의 품질뿐 아니라 발화 교대 동작을 평가한다는 점에서 이러한 변화를 보여줍니다.
기존 파이프라인을 대체하는 것은 무엇일까요?
하나의 대체 방식만 있는 것은 아닙니다. 음성 AI는 크게 세 방향으로 나뉘고 있습니다.
1. 스트리밍 단계별 연결 방식
ASR, 언어 추론, TTS는 여전히 분리되어 있지만, 더 이상 완전히 닫힌 세 상자처럼 작동하지 않습니다. 음성 인식은 부분적인 텍스트를 내보내고, 모델은 점진적으로 작업을 준비하며, 음성 합성은 답변의 첫 번째 안정된 부분부터 시작할 수 있습니다. 발화 교대 모델은 침묵과 언어적 맥락을 함께 사용해 사용자가 말을 마쳤는지 추정합니다.
이 접근법은 명시적인 대화 기록, 공급업체별 모듈 구성, 익숙한 정책 검증 지점을 유지합니다. 구조화된 고객 지원, 규제 대상 업무, 기존 텍스트 에이전트에 실용적인 선택인 경우가 많습니다. 품질은 각 단계의 조율에 달려 있습니다. 부분 기록은 바뀔 수 있고, 미리 시작한 작업은 틀릴 수 있으며, 발화 종료를 성급하게 판단하면 시간을 아끼는 대신 사용자 말을 더 자주 끊을 수 있습니다.
2. 음성 네이티브 음성-음성 모델
음성 네이티브 모델은 대화 기록을 핵심 추론 인터페이스로 반드시 거치지 않고 오디오 표현을 입력받아 오디오를 생성합니다. 자막, 기록 또는 내부 보조용으로 텍스트를 생성할 수도 있지만, 음향 정보로 직접 작업할 수 있습니다.
Kyutai의 Moshi 연구는 공개된 대표 사례입니다. 사용자와 비서의 오디오를 병렬 스트림으로 표현하며 지속해서 듣고 생성하도록 설계됐습니다. 논문은 해당 연구 시스템의 이론적 지연을 160밀리초, 실제 지연을 약 200밀리초로 보고합니다. Moshi는 ‘Inner Monologue’에서 시간에 맞춰 정렬된 텍스트도 사용합니다. 음성 네이티브가 반드시 텍스트를 전혀 쓰지 않는다는 뜻은 아니라는 점을 보여줍니다.
3. 음성 프런트엔드와 에이전트 백엔드를 결합한 방식
실제 서비스에서는 혼합형 설계가 떠오르고 있습니다. 실시간 오디오 모델이 타이밍, 발화 교대, 음성 출력을 맡고, 별도의 에이전트나 서비스가 더 깊은 추론, 정보 검색, 권한 확인, 도구 사용을 처리합니다. 백엔드가 일정을 확인하거나 주문을 조회하거나 여러 단계를 계획하는 동안 음성 계층은 사용자의 말을 확인해 주거나 명확히 해 달라고 질문할 수 있습니다.
이 역할 분담은 콜센터뿐 아니라 기기에서도 중요합니다. AI 에이전트 폰에서 음성은 목표를 전달하는 가장 빠른 방법일 수 있지만, 실제 유용성은 요청 이후의 맥락, 도구, 권한, 실행, 복구에 달려 있습니다. Meydo의 Meydo OS와 DroiClaw 소개는 음성을 독립적인 채팅 기능으로 보기보다 멀티모달 입력을 권한에 기반한 행동으로 연결하려는 관련 시스템 수준의 목표를 설명합니다.
새로운 설계 단위는 상호작용의 전체 과정입니다
오디오가 연속적으로 처리되면 팀은 인식 정확도와 목소리 품질 이상의 것을 설계해야 합니다. 상호작용 과정에는 다음이 포함됩니다.
- 발화 종료 판단: 사용자가 잠시 멈춘 것인지, 말을 마친 것인지, 응답을 기다리는 것인지 판단할 수 있나요?
- 끼어들기: 사용자의 발화가 현재 답변을 취소하거나 일시 중지하거나 다른 방향으로 바꿔야 하나요?
- 짧은 호응: 시스템이 발언권을 가져가지 않고도 호응할 수 있나요?
- 응답 근거: 어떤 단어, 음향 단서, 화면 맥락, 도구 결과가 답변의 근거가 되나요?
- 행동의 경계: 어떤 작업은 그대로 진행할 수 있고, 어떤 작업은 확인이 필요한가요?
- 오류 복구: 사용자가 이름을 바로잡거나, 행동을 취소하거나, 중단 이후 대화를 이어갈 수 있나요?
- 상태 관리: 모델이 실제로 말한 내용, 재생된 내용, 도구가 실제로 완료한 작업을 구분해 기억하나요?
자연스러운 목소리는 오류를 덜 믿게 하는 대신 오히려 더 믿게 만들 수 있습니다. 결과가 중요한 행동에서는 대화 속도를 높이더라도 확인, 권한 부여, 확인 가능한 기록을 없애서는 안 됩니다. 빠른 ‘완료’는 실제 작업이 검증된 뒤에만 의미가 있습니다.
단계별 연결 시스템이 사라지지 않는 이유
음성 네이티브 방식에는 분명한 장점이 있지만, 아키텍처 선택은 성숙도 순위를 매기는 일이 아니라 여러 조건 사이의 절충입니다. OpenAI의 현행 음성 에이전트 안내는 자연스럽고 지연이 적은 상호작용에는 음성-음성 세션을, 예측 가능한 업무나 기존 텍스트 에이전트 및 중간 단계의 명시적 제어에는 단계별 연결 파이프라인을 적합한 방식으로 제시합니다.
다음이 필요한 팀에는 단계별 연결 방식이 더 나을 수 있습니다.
- 오래 보관하고 검토할 수 있는 대화 기록;
- 음성을 출력하기 전의 결정론적 텍스트 검증;
- ASR, 모델 또는 음성 공급업체를 독립적으로 교체할 수 있는 구조;
- 언어별 구성 요소 또는 맞춤 어휘;
- 도구 사용과 규제 대상 결정에 관한 명확한 감사 지점; 또는
- 이미 검증된 텍스트 업무에 경제적으로 덧붙일 수 있는 음성 계층.
끼어들기, 표현력 있는 말하기, 빠른 발화 교대, 음향 맥락이 경험의 핵심이라면 음성 네이티브 또는 혼합형 실시간 오디오 설계가 더 적합할 수 있습니다. 많은 제품은 일상 대화를 위한 유연한 음성 경로와 민감한 행동을 위한 통제된 경로를 함께 지원할 것입니다.
최신 음성 AI 시스템을 평가하는 방법
잘 다듬어진 한 차례의 시연만 보고 판단하지 마세요. 실제와 비슷한 조건에서 상호작용 전체를 시험해야 합니다.
- 지연을 한 가지만 측정하지 마세요. 발화 종료부터 첫 오디오 출력까지의 시간, 유용한 답변까지의 시간, 행동 완료까지의 시간을 기록하세요. 최상의 실행 사례뿐 아니라 일반적인 경우와 느린 경우도 보고해야 합니다.
- 말을 끊어 보세요. 초반의 정정, 답변 후반의 끼어들기, 짧은 호응을 시험하세요. 재생이 멈추는지, 다음 답변이 사용자가 듣지 못한 말에 의존하지 않는지 확인하세요.
- 오디오 조건을 바꿔 보세요. 대상 사용자에 맞는 억양, 언어 전환, 이름, 숫자, 작은 목소리, 소음, 여러 화자를 사용하세요.
- 도구와 확인 절차를 점검하세요. 행동 전에 도구 인수를 검증하고, 실행 후에는 대상 시스템의 상태를 다시 확인하세요. 확신에 찬 음성 답변은 작업 완료의 증거가 아닙니다.
- 대화 기록의 성격을 확인하세요. 기록을 저장한다면 그것이 확정적인 기준인지, 아니면 오디오 모델이 이해한 내용을 대략 표현한 것일 뿐인지 확인하세요.
- 실패 상황을 시험하세요. 네트워크를 끊고, 도구 응답을 지연시키고, 권한을 거부하고, 잘못 인식한 대상을 정정해 보세요. 오류 복구 품질은 이상적인 경로보다 중요한 경우가 많습니다.
- 개인정보 보호와 보관 정책을 검토하세요. 원본 오디오, 대화 기록, 성문 정보, 도구 결과가 어디에서 처리되고 보관되며 누가 접근할 수 있는지 확인하세요.
‘듣고, 생각하고, 말하기’ 다음은 무엇일까요?
다음 모델은 계속 듣고, 점진적으로 해석하고, 신중하게 행동하며, 상황에 맞춰 말하기에 더 가깝습니다. 이러한 활동은 서로 겹칠 수 있습니다. 비서는 답변을 준비하면서 발화가 끝나가는 것을 감지하고, 말하는 동안 계속 들으며, 진행 상황을 사용자에게 알리면서 작업을 다른 시스템에 맡길 수 있습니다.
그렇다고 기존 파이프라인이 사라지는 것은 아닙니다. 다만 모든 음성 경험에 적용하는 기본 사고방식으로서의 지위가 달라집니다. 적합한 아키텍처는 과업에 따라 결정됩니다. 타이밍과 표현력이 중요하면 음성 네이티브 방식, 점검과 제어가 중요하면 모듈형 단계, 대화를 신뢰할 수 있는 행동으로 연결해야 한다면 혼합형 방식이 적합합니다.
자주 묻는 질문
음성-음성 AI란 무엇인가요?
음성-음성 AI는 말로 입력을 받고 음성을 직접 처리해 말로 답합니다. 대화 기록을 제공할 수도 있지만, ASR 시스템과 텍스트 모델, TTS 사이에서 반드시 거쳐야 하는 연결 고리일 필요는 없습니다.
음성 AI에서 전이중은 무엇을 뜻하나요?
전이중은 시스템이 듣기와 오디오 출력을 동시에 할 수 있다는 뜻입니다. 실제로 유용한 전이중 에이전트라면 끼어들기와 짧은 호응도 인식하고, 출력을 멈추거나 조정하며, 발화가 겹친 뒤에도 정확한 상태를 유지해야 합니다.
음성 네이티브 모델은 언제나 ASR–LLM–TTS 파이프라인보다 빠른가요?
아닙니다. 음성 네이티브 모델은 순차 처리 경계를 일부 없애지만, 실제 지연은 모델 크기, 하드웨어, 네트워크 전송, 발화 종료 판단, 도구 호출, 재생에도 좌우됩니다. 스트리밍이 잘 설계된 단계별 연결 방식은 배포가 잘못된 음성 네이티브 모델보다 빠를 수 있습니다. 애플리케이션 전체를 측정해야 합니다.
음성 네이티브 모델도 텍스트를 사용하나요?
사용할 수 있습니다. 텍스트는 추론, 자막, 검색, 안전성 검사, 기록에 도움이 될 수 있습니다. ‘음성 네이티브’는 모델이 오디오 표현을 직접 입력받거나 생성할 수 있다는 뜻이지, 내부와 외부의 모든 표현이 오디오여야 한다는 뜻은 아닙니다.
더 사람처럼 말하는 음성 AI가 더 정확한가요?
아닙니다. 자연스러운 타이밍과 표현력 있는 말투는 상호작용을 개선하지만 사실이나 행동을 검증하지는 않습니다. 정확성, 도구 결과, 권한, 실행 후 검증은 별도로 평가해야 합니다.
고지 및 출처
이 글은 공개 기술 문서와 연구를 분석한 것으로, 특정 상용 시스템의 벤치마크가 아닙니다. Meydo는 개인용 AI 기기에 상업적 이해관계가 있습니다. 성능은 모델, 하드웨어, 네트워크 상태, 언어, 애플리케이션 설계에 따라 달라집니다.
- OpenAI: GPT-4o 소개 (2024년 5월 13일)
- OpenAI API: 음성 에이전트—음성-음성 및 단계별 연결 아키텍처 (2026년 9월 29일 확인)
- OpenAI API: 실시간 대화 (2026년 9월 29일 확인)
- Kyutai: Moshi—실시간 대화를 위한 음성·텍스트 기반 모델 (2024년)
- Full-Duplex-Bench: 발화 교대 능력으로 전이중 음성 대화 모델을 평가하는 벤치마크 (2025년)
- Stivers 외: 대화의 발화 교대에 나타나는 보편성과 문화적 차이 (PNAS, 2009년)
