tokv3_v01_d20m
d20m (27.1M parameters) on plus_clean subset, trained on RTX 3060 12GB (Home GPU). Started 2 Oct 2026, ended 2 Oct 2026.
Hypothesis
Control arm: the released v0.1 tokenizer on a 23.5% subset of the plus_clean slice.
What we learned
ex-Gita 0.7177; neither candidate beat it. Released as sansar-20m v0.1.0.
Scores
Bits per byte, lower is better.
ex-Gītā (headline)
0.7177
bits per byte
ex-Gītā, clean_v1
—
bits per byte
Pooled, all five sets
0.7102
bits per byte
Validation split
0.6975
bits per byte
| Test set | TOK-v3 v0.1 |
|---|---|
| DCS gold (classical) | 0.7065 |
| Bhagavad-gītā (memorisation) | 0.5129 |
| Out of domain | 0.7225 |
| Prose | 0.6887 |
| Vedic (Ṛgveda) | 0.9685 |
Curves
Training loss
Cross-entropy per token, by step. The first few percent of the run, far higher, run off the top; hover or the table has every value.
Held-out bits per byte
The validation split, evaluated during training, by step. Lower is better.
Throughput
Tokens per second, by step.
Model
- Preset
- d20m
- Parameters
- 27,073,024
- Outside embeddings
- 18,881,024
- Layers · heads · width
- 6 · 8 · 512
- Tokenizer
- SLP1 unigram 8k
Data
- Slice
- plus_clean subset
- Words
- —
- Training tokens
- 342,491,547
- Passes
- 1 passes
- Tokens seen
- 342,491,136
Compute
- GPU
- RTX 3060 12GB
- Where
- Home GPU
- Steps
- 6,968 / 6,968
- GPU hours
- 0.85
- Cost
- —
- Spot restarts
- —
Lineage
homed20m