Skip to main content

Module quantize

Module quantize 

Source
Expand description

Precision conversion passes for NPU quantization.

Rewrites array<f32> global variable types to lower-precision element types suitable for specific NPU backends.

Supports both naive type rewriting and calibration-based quantization with proper scale/zero_point computation.

Structs§

CalibrationData
Calibration data for the entire module.
F32ToBf16
Converts array<f32> global variables to array<bf16>.
F32ToF16
Converts array<f32> global variables to array<f16>.
F32ToInt8
Converts array<f32> global variables to array<i8>.
MixedPrecisionPass
Mixed-precision quantization pass.
MixedPrecisionPolicy
Policy for choosing per-layer precision in mixed-precision quantization.
PerChannelQuantParams
Per-channel quantization parameters.
QuantizationParams
Parameters describing how floating-point values were quantized to integers.
SensitivityScore
Sensitivity score for a single layer (lower = more sensitive).
TensorCalibration
Calibration data for a single tensor, identified by binding.

Functions§

compute_calibrated_params
Compute per-tensor quantization parameters from calibration data and module.
estimate_sensitivity
Compute sensitivity scores for all storage globals in a module.
policy_from_sensitivity
Build a mixed-precision policy from sensitivity scores.

Type Aliases§

LayerPrecision
Target precision for a single layer/variable in mixed-precision mode.