API Reference
Audion 서비스 API 문서 목록입니다.
Studio
Signal Processing
음성·영상 미디어 파일에서 오디오·음성 신호를 추출하는 API
v1.3.0
Media Processing
오디오 제거·더빙 등 비디오·오디오 편집 작업을 수행하는 API
v0.2.3
Voice Activity Detection
오디오에서 음성·비음성 구간을 검출하는 NeMo MarbleNet 기반 VAD API
v0.2.1
Voice Separation
Open-Unmix 기반으로 보컬·베이스·드럼 등 음원을 분리하는 API
v1.4.0
Speaker Diarization
Ultra-Sortformer 기반으로 최대 8명까지 화자별 구간을 분할하는 API
v0.5.0
Speaker Recognition
SpeechBrain 임베딩으로 화자 식별(1:N)·검증(1:1)·등록을 수행하는 API
v0.2.0
Speech-to-Text
음성·영상 파일을 텍스트로 변환하는 Wave2Vec2 기반 STT API
v1.1.4
Forced Alignment
MMS_FA 모델로 전사 텍스트와 오디오를 정렬해 단어·행 단위 타임스탬프를 생성하는 API
v0.2.0
Speech-to-Text Post-Processing
STT 결과를 SRT·VTT·전사 텍스트 자막 파일로 변환하는 API
v0.3.0
BIO
Vocal Biomarkers
음성에서 Pitch·MFCC·Shimmer·HNR 등 음향 바이오마커를 추출하고 감정·치매·우울 추론을 수행하는 API
v0.3.4
Emotion Recognition
음향 바이오마커 시퀀스에서 음성 감정 7종을 분류하는 API
v0.1.0
Dementia Detection
음향 바이오마커 시퀀스로 치매 여부(control·dementia)를 예측하는 API
v0.1.0
Depression Detection
음향 바이오마커 시퀀스로 우울 여부(negative·positive)를 예측하는 API
v0.1.0