OCR pilot 100k

OCR Running

ocr_pilot100k

, trained on L4 (AWS, spot). .

Hypothesis

Bulk OCR of about 100,000 scanned pages (127 books) with OCR-VLM v1 on spot GPUs.

What we learned

Runs in short spot sessions that resume page by page.

Scores

No scores published yet. The held-out scores are published when the run finishes; the live card above shows the latest evaluation during training.

Curves

Training loss

Cross-entropy per token, by step. The first few percent of the run, far higher, run off the top; hover or the table has every value.

Held-out bits per byte

The validation split, evaluated during training, by step. Lower is better.

Throughput

Tokens per second, by step.

Model

Preset
—
Parameters
—
Outside embeddings
—
Layers · heads · width
— · — · —
Tokenizer
—

OCR-VLM v1 (vLLM)

Data

Slice
—
Words
—
Training tokens
—
Passes
—
Tokens seen
—

Compute

GPU
L4
Where
AWS (spot)
Steps
—
GPU hours
—
Cost
$5.81
Spot restarts
0

Lineage

awsspot