🚀 Highlights
🚀
Model Autostart
Models automatically resume after system startup or recovery, reducing manual intervention and improving service continuity.
🔐
Enhanced Security & Permissions
Remote-code execution controls, API Key / User / Permission upgrades, and aligned scope isolation.
🧠
New Models
VibeThinker 1.5B / 3B, Nex-N2 series, Ornith-1.0-35B, Unlimited-OCR
📊
Observability
Grafana Dashboard split into 6 sub-panels, unified Prometheus metrics, new replica_index metric.
Community Edition
pip install 'xinference==2.12.0'
or pull the latest Docker image
🆕 New Model Support
- VibeThinker 1.5B / 3B (Transformers + vLLM)
- Nex-N2 (mini / Pro / Pro-FP8)
- Ornith-1.0-35B
- Unlimited-OCR
✨ New Features
- Model autostart capability
- Remote code execution security controls
- API Key & User Management UI pages
- Embedding / Rerank capability panel enhancements
- Running Model try-to-API quick test
- Unified worker / supervisor / replica metrics
📊 Monitoring Enhancements
- Grafana Dashboard split into 6 sub-views
- Prometheus metrics enhanced (replica_index, etc.)
🛠 Improvements
- Log rotation supports daily + size modes
- Multi-process safe log writing
- Worker IP multi-select filter component
- UI menu / permission system optimization
- Model loading and registration flow improvements
- Structured logging enhancements
🐞 Bug Fixes
- Fixed embedding / rerank model dependency issues
- Fixed vLLM / llama.cpp / tool call compatibility
- Fixed GPU / worker status anomalies
- Fixed OAuth / permission escalation issues
- Fixed cache initialization failure causing metric loss
📚 Documentation
- Multi-language documentation support
- New security policy documentation
- Updated i18n and document structure
Enterprise Edition
🔧 Stability and operational reliability continuously optimized.