Transformers documentation
Optimum
Get started
Base classes
Models
Preprocessors
Inference
Pipeline API
Generate API
Optimization
Chat with models
Serving
Training
Quantization
OverviewSelecting a quantization methodQuantization concepts Contribute
Quantize on the fly
FP4 and FP8 formats
Calibration-based methods
Load pre-quantized models
Hardware toolkits
Ecosystem integrations
Resources
API
You are viewing main version, which requires installation from source. If you'd like
regular pip install, checkout the latest stable version (v5.14.0).
Optimum
Optimum is an optimization library that supports quantization for Intel, Furiosa, ONNX Runtime, GPTQ, and lower-level PyTorch quantization functions. It is designed to enhance performance for specific hardware - Intel CPUs/HPUs, AMD GPUs, Furiosa NPUs, etc. - and model accelerators like ONNX Runtime.
Update on GitHub