오프라인, 스트리밍 및 엣지 배포를 위한 산업용 음성 인식 툴킷.
ASR · VAD · 구두점 · 화자 파이프라인 · 감정 및 오디오 이벤트 모델 · OpenAI 호환 서빙
빠른 시작 · Colab · 모델 선택 · 벤치마크 · Migration guide · Use cases · Deployment matrix · 모델 목록 · Agent 연동 · 문서
pip install funasrfrom funasr import AutoModel
model = AutoModel(model="iic/SenseVoiceSmall", vad_model="fsmn-vad", spk_model="cam++", device="cuda")
result = model.generate(input="meeting.wav")출력 — 화자 라벨, 타임스탬프, 구두점이 포함된 구조화된 텍스트:
[00:00.4 → 00:03.8] 화자0: Q3 계획에 대해 논의하겠습니다.
[00:04.2 → 00:07.1] 화자1: 좋습니다. 세 가지 포인트가 있습니다.
[00:07.5 → 00:12.3] 화자0: 말씀하세요. 30분 남았습니다.
한 번의 AutoModel 파이프라인 호출이지만, SenseVoiceSmall, FSMN-VAD,
CAM++라는 독립된 모델을 조합합니다. 화자 분리는 SenseVoiceSmall 자체가 아니라
CAM++에서 제공합니다.
처음 사용한다면 Colab 빠른 시작으로 먼저 확인할 수 있습니다. 어떤 모델을 선택할지 고민된다면 모델 선택 가이드를 참고하세요.
API 서버로 배포:
funasr-server --device cuda→ localhost:8000에서 OpenAI 호환 엔드포인트AI Agent 연동: MCP 서버 Claude/Cursor 지원 · OpenAI API LangChain/Dify/AutoGen 지원
Whisper는 단일 모델이지만, FunASR는 툴킷입니다. 용도에 맞게 Fun-ASR-Nano(중국어/영어/일본어 및 중국어 방언/지역 억양, GPU), Fun-ASR-MLT-Nano(31개 언어), SenseVoiceSmall(5개 언어 ASR와 감정·오디오 이벤트), Paraformer(저지연 스트리밍)를 선택하세요. 아래 표는 툴킷 전체의 기능과 이를 제공하는 모델 또는 파이프라인을 보여 줍니다:
| FunASR(툴킷) | Whisper | 클라우드 API | |
|---|---|---|---|
| 최고 속도 | 340배 실시간(Fun-ASR-Nano + vLLM) | 13배 실시간 | ~1배 실시간 |
| 화자 인식 | ✅ VAD + CAM++ 파이프라인 | ❌ pyannote 필요 | ✅ 추가 비용 |
| 감정 인식 | ✅ SenseVoice 제공 | ❌ | ❌ |
| 언어 수 | 체크포인트별 상이(예: Qwen3-ASR 52, MLT-Nano 31, Nano 중/영/일) | 57개 | 서비스마다 다름 |
| 스트리밍 | ✅ WebSocket(Paraformer) | ❌ | ✅ |
| CPU 사용 | ✅ 17배 실시간(SenseVoice) | ❌ 너무 느림 | 해당 없음 |
| 자체 호스팅 | ✅ 지원 (툴킷: MIT, 모델별 상이) | ✅ MIT 라이선스 | ❌ 클라우드만 |
| 비용 | 무료 | 무료 | $0.006/분~ |
184개 장시간 오디오(총 192분). 상세 보고서 →
| 모델 | 중국어 CER ↓ | GPU 속도 | CPU 속도 | Whisper-large-v3 대비 |
|---|---|---|---|---|
| Fun-ASR-Nano(vLLM) | 8.20% | 340배 실시간 | — | 🚀 26배 빠름 |
| SenseVoice-Small | 7.81% | 170배 실시간 | 17배 실시간 | 🚀 13배 빠름 |
| Paraformer-Large | 10.18% | 120배 실시간 | 15배 실시간 | 🚀 9배 빠름 |
| Whisper-large-v3-turbo | 21.71% | 46배 실시간 | ❌ | 3.4배 빠름 |
| Whisper-large-v3 | 20.02% | 13배 실시간 | ❌ | 기준선 |
핵심: FunASR의 CPU 속도가 Whisper의 GPU 속도보다 빠릅니다.
- 2026/07/24: v1.3.28 hotfix PyPI 공개 — VAD로 확정된 realtime WebSocket 최종 결과가 짧은 접두사, 반복 hallucination 또는 decode 예외로 퇴화하면 현재 음성 구간을 연속해서 완전히 덮는 clean partial을 보존합니다. 짧은 STOP tail, VAD finalize, 화자 완료 처리도 동일한 안정적인 경로로 통합했습니다. SenseVoice 자막은 rich tag, 구두점, word/BPE timestamp를 올바르게 정렬해 중국어가 하나의 cue로 합쳐지거나 영어 원문이 손상되지 않습니다. 설치:
python -m pip install -U "funasr==1.3.28". Release → - 2026/07/24: v1.3.27 PyPI 공개 — OpenAI 호환 서버가
verbose_json에 SenseVoice 감지 언어를 반환하고, vLLM fallback 후에는 캐시된 Fun-ASR-NanoAutoModel을 재사용합니다. vLLM/VAD 초기화와 fallback이 모두 실패하면 반쯤 초기화된 상태를 남기지 않아 이후 요청에서 다시 시도할 수 있습니다. 설치:python -m pip install -U "funasr==1.3.27". Release → - 2026/07/23: v1.3.26 PyPI 공개 —
funasr-server --model fun-asr-nano --hub ms가 vLLM 경로와 AutoModel fallback 모두에서 ModelScope hub 선택을 존중합니다. 설치:python -m pip install -U "funasr==1.3.26". Release → - 2026/07/23: llama.cpp runtime v0.1.9 — Windows Vulkan용
funasr-llamacpp-windows-x64-vulkan.zip을 추가했습니다. 최신 AMD, Intel 또는 NVIDIA Vulkan 드라이버에서 SenseVoiceSmall을 독립 실행할 수 있습니다. Linux Vulkan, Windows CUDA, CPU/AVX2, Linux arm64, macOS arm64 패키지도 계속 제공합니다. Release → - 2026/07/22: llama.cpp runtime v0.1.8 — Linux Vulkan tarball과 Windows CUDA zip을 포함한 CPU/엣지용 GGUF 런타임입니다. 다운로드와 빠른 시작: funasr.com/llama-cpp · Release →
- 2026/05/24: v1.3.3 —
funasr-serverCLI, OpenAI 호환 API, MCP 서버.pip install --upgrade funasr - 2026/05/20: Qwen3-ASR (0.6B/1.7B) 추가 — 52개 언어 지원.
- 2026/05/20: GLM-ASR-Nano (1.5B) 추가 — 17개 언어, 방언 지원.
- 2026/05/19: Fun-ASR-Nano 및 SenseVoice는 VAD 및 CAM++와 결합하여 화자 분리 파이프라인을 구성할 수 있습니다.
- 2025/12/15: Fun-ASR-Nano-2512 — 중국어, 영어, 일본어 및 중국어 방언 지원.
pip install funasr요구사항: Python ≥ 3.8, PyTorch ≥ 1.13, torchaudio
| 모델 | 작업 | 언어 | 파라미터 | 링크 |
|---|---|---|---|---|
| Fun-ASR-Nano | 인식 | 중/영/일 + 중국어 방언 | 800M | ⭐ 🤗 GGUF |
| Fun-ASR-MLT-Nano | 인식 | 31개 언어 | 800M | ⭐ 🤗 |
| SenseVoiceSmall | 인식 + 감정 + 이벤트 | 중/영/일/한/광둥어 | 234M | ⭐ 🤗 GGUF |
| Paraformer-zh | 인식 + 타임스탬프 | 중/영 | 220M | ⭐ 🤗 |
| Qwen3-ASR | 인식, 52개 언어 | 다국어 | 1.7B | 사용법 |
| GLM-ASR-Nano | 인식, 17개 언어 | 다국어 | 1.5B | 사용법 |
| Whisper-large-v3-turbo | 인식 + 번역 | 다국어 | 809M | 사용법 |
# OpenAI 호환 API (권장)
pip install funasr fastapi uvicorn python-multipart
funasr-server --device cuda
# Docker 스트리밍 서비스
docker pull registry.cn-hangzhou.aliyuncs.com/funasr_repo/funasr:funasr-runtime-sdk-online-cpu-0.1.12CPU/엣지에서 Python 없이 오프라인 ASR만 필요하다면 llama.cpp / GGUF 런타임을 사용할 수 있습니다: funasr.com/llama-cpp · Fun-ASR-Nano-GGUF · SenseVoiceSmall-GGUF.
Colab quickstart → · OpenAI API example → · Client recipes → · Workflow recipes → · Postman collection → · OpenAPI spec → · Security guide → · Deployment matrix → · 배포 문서 → · Agent 연동 →
| 📖 문서 | 🐛 Issues |
| 💬 Discussions | 🤗 HuggingFace |
- 이 저장소의 FunASR 툴킷 소스 코드: MIT License.
- 사전 학습된 모델 가중치는 별도로 라이선스됩니다. 각 모델 카드에 표시된 라이선스를 확인하세요. 모델 카드가 이 저장소의 FunASR Model Open Source License Agreement를 가리키는 경우 해당 조건이 적용됩니다.