Team Ai
Modelpublic

magiccodingman/Jasper-Token-Compression-600M-ONNX-INT8

sourceHugging Faceapache-2.0updated 2mo agoView on Hugging Face
0likes22downloads
Model Card

Jasper Token Compression 600M — ONNX INT-8

ONNX export of infgrad/Jasper-Token-Compression-600M.

Precision: INT8 (Dynamic) Quantization: Dynamic INT8 Model size: 583.56 MiB

Dynamic INT8 ONNX export optimized for fast CPU inference. This is a text embedding model.

Benchmarks

TokensMedian latencyTokens/s
3244.362 ms721.3
12848.609 ms2,633.3
51263.180 ms8,103.8
102484.619 ms12,101.3

Fidelity

Median cosine similarity versus FP32: ~0.988–0.992.

Attribution

Original model: infgrad/Jasper-Token-Compression-600M