vidore/colqwen2.5-v0.2
Primitive: /encode · Encode ·
Qwen2
ColQwen is a model based on a novel model architecture and training strategy based on Vision Language Models (VLMs) to efficiently index documents from their visual features.
View on Hugging Face → Guide: Qwen3 / ColQwen guide → Fine-tuned from vidore/colqwen2.5-base
Overview
Hardware: — drives latency, throughput & cost
| Size | 7.0B params |
|---|---|
| Tasks | /encode |
| License | mit |
| Languages | en |
| Latency | 1.9 s |
| Throughput | 7.6 mpix/s |
| Cost | — /1M tok |
Cost is approximate — computed from list GPU prices; your actual price depends on the provider you deploy SIE with.
Embedding
| Output types | Multi-Vec |
|---|---|
| Dimensions | multivector: 128 |
| Max sequence length | 2,048 |
| Inputs | text · image |
Benchmarks
Vidore3ComputerScienceRetrieval
Visual document retrieval on computer science papers and slides
Vidore3FinanceEnRetrieval
Visual document retrieval on financial reports
Vidore3HrRetrieval
Visual document retrieval on HR-related documents
Vidore3PharmaceuticalsRetrieval
Visual document retrieval on pharmaceutical documents