OCR-VLM v1

OCR DoneWinner

ocrvlm_v1_q35

on OCR page labels, trained on A100 40GB (Google Cloud, spot). Started 5 Oct 2026, ended 5 Oct 2026.

Hypothesis

A 2B open vision-language model fine-tuned on our Sanskrit page labels beats Google Vision's 1.69% letter error rate.

What we learned

Yes: median letter error 0.96% on 54 held-out pages, 43% lower than Google Vision, at about 9,300 pages an hour on an A100. Chosen for bulk OCR.

Scores

Lower is better on the headline; change against the parent run, OCR-VLM pilot.

Median letter error rate
0.0096
letter error rate · headline

Letter error rate: the share of letters an OCR model reads wrong, as a fraction (0.0096 means 0.96% of letters). Lower is better.

Curves

Training loss

Cross-entropy per token, by step. The first few percent of the run, far higher, run off the top; hover or the table has every value.

Held-out bits per byte

The validation split, evaluated during training, by step. Lower is better.

Throughput

Tokens per second, by step.

Model

Preset
—
Parameters
—
Outside embeddings
—
Layers · heads · width
— · — · —
Tokenizer
Qwen3.5 tokenizer

Qwen3.5-2B full fine-tune, 8-bit AdamW

Data

Slice
OCR page labels
Words
—
Training tokens
—
Passes
—
Tokens seen
77,373,646

Compute

GPU
A100 40GB
Where
Google Cloud (spot)
Steps
2,000 / 2,000
GPU hours
7.33
Cost
$9.53
Spot restarts
0

Lineage

gcpa100spot