OCR-VLM pilot

OCR DoneKeep

ocrvlm_pilot_q35

on OCR page labels, trained on A100 40GB (Google Cloud, spot). Started 4 Oct 2026, ended 4 Oct 2026.

Hypothesis

Short pilot of fine-tuning a 2B open vision-language model (Qwen3.5-2B) on our page-OCR labels, to set the learning rate.

What we learned

300 steps, validation only; its settings carried into OCR-VLM v1.

Scores

No scores published yet.

Curves

Training loss

Cross-entropy per token, by step. The first few percent of the run, far higher, run off the top; hover or the table has every value.

Held-out bits per byte

The validation split, evaluated during training, by step. Lower is better.

Throughput

Tokens per second, by step.

Model

Preset
—
Parameters
—
Outside embeddings
—
Layers · heads · width
— · — · —
Tokenizer
Qwen3.5 tokenizer

Qwen3.5-2B full fine-tune, 8-bit AdamW

Data

Slice
OCR page labels
Words
—
Training tokens
—
Passes
—
Tokens seen
11,877,635

Compute

GPU
A100 40GB
Where
Google Cloud (spot)
Steps
300 / 300
GPU hours
1.37
Cost
$1.80
Spot restarts
0

Lineage

gcpa100spot