Expand description
Precision conversion passes for NPU quantization.
Rewrites array<f32> global variable types to lower-precision
element types suitable for specific NPU backends.
Supports both naive type rewriting and calibration-based quantization with proper scale/zero_point computation.
Structs§
- Calibration
Data - Calibration data for the entire module.
- F32To
Bf16 - Converts
array<f32>global variables toarray<bf16>. - F32To
F16 - Converts
array<f32>global variables toarray<f16>. - F32To
Int8 - Converts
array<f32>global variables toarray<i8>. - Mixed
Precision Pass - Mixed-precision quantization pass.
- Mixed
Precision Policy - Policy for choosing per-layer precision in mixed-precision quantization.
- PerChannel
Quant Params - Per-channel quantization parameters.
- Quantization
Params - Parameters describing how floating-point values were quantized to integers.
- Sensitivity
Score - Sensitivity score for a single layer (lower = more sensitive).
- Tensor
Calibration - Calibration data for a single tensor, identified by binding.
Functions§
- compute_
calibrated_ params - Compute per-tensor quantization parameters from calibration data and module.
- estimate_
sensitivity - Compute sensitivity scores for all storage globals in a module.
- policy_
from_ sensitivity - Build a mixed-precision policy from sensitivity scores.
Type Aliases§
- Layer
Precision - Target precision for a single layer/variable in mixed-precision mode.