v0.1.8

Gen-Verse/MMaDAv0.1.8Mar 23, 2026by chonknick

AI Summary

Optimized reranking performance through multi-threading, memory mapping, and optimized model formats, resulting in a 3.3x speedup.

Key Highlights

  • 3.3x faster reranking for all packages
  • Single rerank pass instead of per-package (eliminates redundant ONNX loads)
  • ORT format (flatbuffer) with automatic fallback to `.onnx`
  • mmap model loading for zero-copy memory access
  • Multi-threaded inference using half available cores (capped at 4)

New Features

  • Multi-threaded inference
  • ORT format support
  • Memory-mapped model loading

Full Release Notes

## What's Changed

### Reranking Performance Overhaul (3.3x faster)

- **Single rerank pass** — collect all FTS5 results across packages, rerank once instead of per-package (eliminates redundant ONNX session loads)
- **ORT format** — pre-optimized flatbuffer model (`reranker.ort`) for faster deserialization, with automatic fallback to `.onnx`
- **mmap model loading** — zero-copy memory-mapped file access via `commit_from_memory_directly`
- **Multi-threaded inference** — uses half available cores (capped at 4) for ONNX intra-op parallelism

### Benchmarks

| Scenario | v0.1.7 | v0.1.8 | Speedup |
|----------|--------|--------|---------|
| All packages (11) | 1.01s | **0.31s** | 3.3x |
| Single package | 0.09s | **0.04s** | 2.3x |