Xorbits Inference (Xinference)는 언어, 음성 인식, 멀티모달 모델을 위한 강력하고 다목적의 라이브러리입니다. Xinference를 사용하면 단 한 줄의 명령으로 자체 모델이나 통합된 최첨단 모델을 배포하고 서비스로 제공할 수 있습니다. 연구자, 개발자, 데이터 과학자 모두 최신 AI 모델의 기능을 최대한 활용할 수 있습니다.
- Xinference 3.0.0이 마이그레이션 안내와 호환되지 않는 변경 사항과 함께 제공됩니다: 릴리스 노트
- 에이전트 네이티브 배포: Xinference는 Xagent와 통합되어 동적 플래닝, 도구 사용 및 자율적 다단계 추론을 지원하며 정적 파이프라인의 한계를 넘어섭니다.
- 자동 배칭: 여러 동시 요청을 자동으로 묶어 처리량을 크게 향상시킵니다. : #4197
- Xllamacpp: Xinference 팀이 관리하는 새로운 llama.cpp Python 바인딩은 연속 배칭을 지원하며 프로덕션에 더 적합합니다. : #2997
- 분산 추론: 모델을 여러 워커에 걸쳐 실행할 수 있습니다: #2877
- vLLM 개선: 여러 복제본 간 KV 캐시 공유: #2732
- Breeze-TTS-2 기본 지원: #5437
- WeMM-Embedding 시리즈 기본 지원 (2B, 4B, 9B): #5439
- NaviDC-OCR 기본 지원: #5431
- Kimi-K3 기본 지원: #5417
- 월드 모델 기본 지원 (Matrix-Game-3.0-5B, HY-WorldPlay-5B, Astra): #5414
- Krea 2 시리즈 기본 지원 (Raw, Turbo): #5419
- ACE-Step 1.5 기본 지원: #5413
- Ornith 1.5 시리즈 기본 지원 (35B-A3B, 397B): #5406, #5405
- GLM-5.2 기본 지원: #5404
- GLM-Image 기본 지원: #5394
- HiDream-O1 시리즈 기본 지원 (Image, Image-Dev, Image-Dev-2604): #5370
- SenseNova-U1.5-8B-MoT 기본 지원: #5369
- Ideogram4 기본 지원: #5367
- DeepSeek-V4-Flash-0731 기본 지원: #5371
- FireRedTTS3 기본 지원: #5352
- MiniMax-Music3 기본 지원: #5345
- Qwen3.8 시리즈 기본 지원 (27B, 2.4T-A95B): #5337, #5339
- jina-reranker-m0 기본 지원: #5327
- OvisOCR2 기본 지원: #5322
- IndexTTS-2.5 기본 지원: #5319
- Ling-3.0 시리즈 기본 지원 (tiny, flash): #5311
- MiniMax-H3 및 Lightning LoRA 기본 지원: #5321, #5338
- Wan2.2 Animate 2 시리즈 기본 지원 (14B, 14B Distilled): #5309
- FireRed-Image-Edit-1.1 기본 지원: #5306
- CAMPPlus 화자 임베딩 시리즈 기본 지원 (중국어, 중국어-영어 고급): #5298
- DeepDoc 기본 지원: #5230
- jina-reranker-v3.5 기본 지원: #5269
- R3 시리즈 기본 지원 (embedding, reranking): #5272
- Xagent: 플래닝, 메모리, 툴 통합을 제공하는 엔터프라이즈 에이전트 플랫폼.
- Dify: 시각화와 제어가 가능한 LLMOps 플랫폼.
- FastGPT: 데이터 처리와 모델 호출을 위한 LLM 기반 지식 플랫폼.
- RAGFlow: 문서의 심층 이해를 위한 오픈소스 RAG 엔진.
- MaxKB: RAG 통합형 오픈소스 지식베이스 어시스턴트.
🌟 모델 배포 간소화: LLM, 음성 인식, 멀티모달 모델의 배포를 단순화합니다. 실험용 및 프로덕션 모델을 단일 명령으로 설정하고 배포할 수 있습니다.
⚡️ 최첨단 모델에 대한 쉬운 접근성: 통합된 최신 모델을 단 한 명령으로 시험해볼 수 있습니다. Xinference는 오픈소스 최첨단 모델에 대한 접근을 제공합니다.
🖥 이기종 하드웨어 지원: GPU와 CPU를 효율적으로 활용(예: ggml)하여 추론 속도를 높입니다.
⚙️ 유연한 API 및 인터페이스: OpenAI 호환 RESTful API(함수 호출 포함), RPC, CLI, Web UI 등 다양한 인터페이스를 제공합니다.
🌐 분산 배포: 여러 장치와 머신에 걸친 분산 추론을 용이하게 합니다.
🔌 서드파티 통합: LangChain, [LlamaIndex], [Dify], [Chatbox] 등과의 통합을 지원합니다.
| 기능 | Xinference | FastChat | OpenLLM | RayLLM |
|---|---|---|---|---|
| OpenAI 호환 RESTful API | ✅ | ✅ | ✅ | ✅ |
| vLLM 통합 | ✅ | ✅ | ✅ | ✅ |
| 다양한 추론 엔진(GGML, TensorRT) | ✅ | ❌ | ✅ | ✅ |
| 다양한 플랫폼(CPU, Metal) | ✅ | ✅ | ❌ | ❌ |
| 멀티노드 클러스터 배포 | ✅ | ❌ | ❌ | ✅ |
| 이미지 모델(텍스트→이미지) | ✅ | ✅ | ❌ | ❌ |
| 텍스트 임베딩 모델 | ✅ | ❌ | ❌ | ❌ |
| 멀티모달 모델 | ✅ | ❌ | ❌ | ❌ |
| 음성 모델 | ✅ | ❌ | ❌ | ❌ |
| OpenAI 기능(함수 호출) | ✅ | ❌ | ❌ | ❌ |
-
Self-Hosting Xinference Community Edition 스타터 가이드를 따라 로컬에서 Xinference를 시작하세요. 자세한 내용은 문서(https://inference.readthedocs.io/) 참조.
-
기업용 Xinference 엔터프라이즈 기능이 필요하면 다음으로 문의하세요: mailto:info@xinference.co?subject=[GitHub]Business%20License%20Inquiry
GitHub에서 Xinference에 별을 눌러 릴리스 알림을 받으세요.
NVIDIA GPU 사용자는 Xinference Docker 이미지를 사용할 수 있습니다. 설치 전에 Docker 및 CUDA가 설치되어 있는지 확인하세요.
docker run --name xinference -d -p 9997:9997 -e XINFERENCE_HOME=/data -v </on/your/host>:/data --gpus all xprobe/xinference:latest xinference-local -H 0.0.0.0GPU가 활성화된 Kubernetes 클러스터에서 다음과 같이 설치하세요:
# 레포지토리 추가
helm repo add xinference https://xorbitsai.github.io/xinference-helm-charts
# 인덱스 업데이트 및 버전 확인
helm repo update xinference
helm search repo xinference/xinference --devel --versions
# Xinference 설치
helm install xinference xinference/xinference -n xinference --version 0.0.1-v<xinference_release_version>
자세한 K8s 옵션은 문서를 참조하세요.
pip으로 Xinference를 설치합니다:
pip install "xinference[all]"로컬 인스턴스를 시작하려면:
$ xinference-local그런 다음 Web UI, cURL, CLI 또는 Python 클라이언트를 통해 사용해보세요.
| 플랫폼 | 목적 |
|---|---|
| Github Issues | 버그 리포트 및 기능 요청 |
| Discord | 다른 사용자와 협업 |
| Telegram | 커뮤니티 토론 |
| 공지 및 업데이트 |
이 프로젝트가 유용했다면 다음과 같이 인용해 주세요:
@inproceedings{lu2024xinference,
title = "Xinference: Making Large Model Serving Easy",
author = "Lu, Weizheng and Xiong, Lingfeng and Zhang, Feng and Qin, Xuye and Chen, Yueguo",
booktitle = "Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing: System Demonstrations",
month = nov,
year = "2024",
address = "Miami, Florida, USA",
publisher = "Association for Computational Linguistics",
url = "https://aclanthology.org/2024.emnlp-demo.30",
pages = "291--300",
}

