VISION-OCR A

Sanskrit DoneKeep

visiontest_a_s1337_d20m

d20m (27.1M parameters) on plus_clean subset, trained on RTX 3060 12GB (Home GPU). Started 3 Oct 2026, ended 3 Oct 2026.

Hypothesis

Control: a clean-text subset with no OCR, at 20M.

What we learned

The reference for arms B to D.

Scores

Bits per byte, lower is better.

ex-Gītā (headline)
0.7913
bits per byte
ex-Gītā, clean_v1
—
bits per byte
Pooled, all five sets
0.7856
bits per byte
Validation split
0.7833
bits per byte
Bits per byte on each test set
Test setVISION-OCR A
DCS gold (classical)0.7758
Bhagavad-gītā (memorisation)0.6338
Out of domain0.7976
Prose0.756
Vedic (Ṛgveda)1.0937

Curves

No training curves were published for this run.Its scores above are what it published.

Model

Preset
d20m
Parameters
27,073,024
Outside embeddings
18,881,024
Layers · heads · width
6 · 8 · 512
Tokenizer
SLP1 unigram 8k

Muon + AdamW, rope, qk_norm, relu^2, untied head

Data

Slice
plus_clean subset
Words
—
Training tokens
89,885,258
Passes
1 passes
Tokens seen
89,899,008

Compute

GPU
RTX 3060 12GB
Where
Home GPU
Steps
1,829 / 1,829
GPU hours
0.23
Cost
—
Spot restarts
—

Lineage

homed20m