ocrvlm_v1_q35
on OCR page labels, trained on A100 40GB (Google Cloud, spot). Started 5 Oct 2026, ended 5 Oct 2026.
Hypothesis
A 2B open vision-language model fine-tuned on our Sanskrit page labels beats Google Vision's 1.69% letter error rate.
What we learned
Yes: median letter error 0.96% on 54 held-out pages, 43% lower than Google Vision, at about 9,300 pages an hour on an A100. Chosen for bulk OCR.
Scores
Lower is better on the headline; change against the parent run, OCR-VLM pilot.
Letter error rate: the share of letters an OCR model reads wrong, as a fraction (0.0096 means 0.96% of letters). Lower is better.
Curves
Training loss
Cross-entropy per token, by step. The first few percent of the run, far higher, run off the top; hover or the table has every value.
Held-out bits per byte
The validation split, evaluated during training, by step. Lower is better.
Throughput
Tokens per second, by step.
Model
- Preset
- —
- Parameters
- —
- Outside embeddings
- —
- Layers · heads · width
- — · — · —
- Tokenizer
- Qwen3.5 tokenizer
Data
- Slice
- OCR page labels
- Words
- —
- Training tokens
- —
- Passes
- —
- Tokens seen
- 77,373,646
Compute
- GPU
- A100 40GB
- Where
- Google Cloud (spot)
- Steps
- 2,000 / 2,000
- GPU hours
- 7.33
- Cost
- $9.53
- Spot restarts
- 0
Lineage
gcpa100spot