User Prompt
상황과 대사 입력
Expression Sound Engine
ESE(Expression Sound Engine)는 율랩이 개발한 Expressive Layer입니다. LLM이 해석한 감정 구조를 호흡, 압력, 지연, 사운드, 떨림, 깊이 같은 표현 파라미터로 변환해 AI가 더 인간적으로 말하고 노래하도록 만드는 표현 엔진입니다.
Definition
ESE는 텍스트를 직접 읽는 TTS가 아닙니다. 또한 감정을 기쁨, 슬픔, 분노처럼 분류하는 Emotion AI도 아닙니다.
ESE는 LLM과 음성 합성 모델 사이에 위치하는 중간 엔진으로, 화면과 대사 안에 담긴 감정 구조를 실제 음성 표현값으로 변환합니다.
같은 “기다렸어”라는 말이라도 위로, 서운함, 체념, 반가움은 서로 다른 호흡과 압력, 침묵과 어미를 가져야 합니다. ESE는 이 차이를 감정 라벨이 아니라 표현의 흐름으로 다룹니다.
“감정이 아니라 표현을 다룹니다.”
“라벨이 아니라 흐름을 구조화합니다.”
Architecture
상황과 대사 입력
감정 구조, 관계 맥락, 온도, 감정 흐름 해석
감정 구조를 표현 파라미터 벡터로 변환
표현값을 반영한 음성 생성
상황과 감정을 반영한 최종 음성 출력
LLM의 역할은 감정 해석입니다. ESE의 역할은 표현 변환입니다. TTS의 역할은 최종 음성 출력입니다. 율랩은 그 사이에서 비어 있던 표현 레이어를 구축합니다.
Parameters
사람의 목소리는 감정 이름만으로 설명되지 않습니다. 같은 슬픔이라도 어떤 슬픔은 담담하고, 어떤 슬픔은 무너지고, 어떤 그리움은 미련보다 체념에 가깝습니다.
호흡의 밀도와 흔들림
말 전후의 침묵 길이
감정이 머뭇거리는 지연감
소리의 힘과 압력
발화에 담긴 에너지
음정의 곡선과 이동
어미가 흐르는 방향
미세한 떨림과 흔들림
말의 속도와 밀도
소리의 깊이와 거리감
감정이 눌리거나 응축되는 정도
Feedback
ESE는 문장만 바꾸는 것이 아니라 호흡, 압력, 침묵, 어미의 흐름을 다시 조정합니다.
감정 라벨이 아니라 표현 파라미터를 조절해 연기 방향을 더 정밀하게 반영합니다.
LLM의 의도 해석과 음성 생성 사이에서 표현값을 다시 매핑합니다.
사용자는 AI 음성을 단순히 재생성하는 것이 아니라, 감독이나 성우 디렉터처럼 표현을 직접 연출할 수 있습니다.
Why Now
오늘의 AI는 이미 많은 것을 할 수 있습니다. 글을 쓰고, 그림을 만들고, 영상을 생성하고, 대화를 구성합니다.
하지만 사람이 AI를 자연스럽다고 느끼는 순간은 정보의 정확성만으로 오지 않습니다. 말의 결, 감정의 압력, 침묵의 길이, 숨을 쉬는 방식 같은 표현이 함께 작동해야 비로소 인간적으로 느껴집니다.
Difference
ESE는 LLM 위에 얹히는 표현 레이어입니다. 감정 해석이 정교해질수록 더 정밀한 표현 입력을 받아 더 자연스러운 출력을 만들 수 있습니다.
율랩은 단어가 아니라 호흡, 속도, 압력, 억양, 침묵의 패턴을 추적합니다. 감정이 어떻게 들리는지를 데이터화합니다.
AI Voice, 오디오북, 게임 NPC, AI Companion, 교육, 상담, 영상 생성 등 표현이 필요한 다양한 시스템 위에 얹을 수 있습니다.
Products / Platform
율랩은 ESE를 단일 데모 기술로 두지 않습니다. 보컬, 국악, 음성 표현 분석 등 다양한 분석 앱과 AI 제품이 연결되는 구조로 확장하고 있습니다.
SORI:ON은 그 제품군을 모아 보여주는 ESE 기반 플랫폼입니다.
SORI:ON
SORI:ON은 ESE 기반 분석 앱과 표현 AI 제품들을 연결하는 플랫폼입니다. VOXGO, PansoriGo, 그리고 앞으로 확장될 다양한 분석 앱을 하나의 구조 안에서 보여주는 율랩의 제품 허브입니다.
Applications
감정 표현이 필요한 AI 성우, 더빙, 내레이션
장면과 인물 감정에 맞춘 낭독 표현
상황과 관계를 반영하는 캐릭터 음성
대화 맥락에 맞춘 정서적 응답
보컬, 말하기, 발성의 표현 피드백
콘텐츠 제작을 위한 표현형 음성 생성
FAQ
아닙니다. ESE는 텍스트를 직접 읽는 음성 합성기가 아니라, LLM의 감정 해석 결과를 TTS가 표현할 수 있는 파라미터 구조로 바꾸는 엔진입니다.
아닙니다. ESE는 감정 이름보다 감정을 느끼게 만드는 표현 물리량을 다룹니다. 율랩은 감정을 분류하는 것보다 표현을 제어하는 것에 집중합니다.
ESE는 특정 단일 모델에 종속되지 않는 레이어 구조를 지향합니다. LLM의 감정 해석 결과와 음성 생성 모델 사이에서 작동하도록 설계됩니다.
Build With YULLAB
율랩은 목소리와 음악 안에 담긴 표현을 분석하고, 비교하고, 생성할 수 있는 구조로 바꾸고 있습니다. ESE는 AI가 사람처럼 말하고 노래하도록 만드는 표현 인프라입니다.