Core GPT
11 layers, 512d, 8 GQA heads, 4 KV heads, 4× MLP, seq 2048, vocab 8192 BPE.
Сжать языковую модель до 16 мегабайт и обучить её за 600 секунд. Один артефакт. Жёсткий протокол. Многоголовая оптимизация — одна цель: минимальный BPB.
HYDRA Golf — не демо и не маркетинговый лендинг. Это исследовательская платформа для экстремального сжатия LLM: архитектура, квантование, расписание обучения и верификация результатов в одном репозитории. Форк соревнования OpenAI, доведённый до инженерной зрелости v6.1.
Parameter Golf — открытое соревнование OpenAI: обучить наименьшую языковую модель, которая помещается в 16 MB и показывает лучший bits-per-byte (BPB) на валидации FineWeb. HYDRA Golf — исследовательский форк Evreu1pro, где каждый эксперимент документирован, воспроизводим и проверяется по строгому протоколу.
Гидра — метафора многофронтовой оптимизации. Отруби одну «голову» (квантование,
архитектуру или schedule) — остальные всё равно тянут результат вперёд.
Репозиторий хранит десятки верифицированных экспериментов в records/
и единый исполняемый entrypoint train_gpt.py.
Мы участвуем в OpenAI Parameter Golf — форк Evreu1pro/parameter-golf хранит верифицированные прогоны, воспроизводимые записи и инженерную платформу HYDRA. Наш лучший стек попадает в топ исторического лидерборда.
| Rank | Run | BPB | Author | Date |
|---|---|---|---|---|
| #1 | Calib32 N-gram + AsymLogit Stack | 1.0565 | codemath3000 | 2026-05-01 |
| #2 | Progressive Context + Score-First TTT | 1.0576 | simonbissonnette | 2026-04-30 |
| #3 | Long-Context No-Q/V TTT + QK 5.25 | 1.0586 | andrewbaggio1 | 2026-04-30 |
| #4 | AWQ-Lite GPTQ + AsymLogit | 1.0594 | alertcat | 2026-04-29 |
| #5 | SmearGate + LQER + SparseAttnGate + 9-Hparam | 1.06108 | HYDRA / codemath3000 stack | 2026-04-27 |
| … | 3-Layer Recurrence baseline | 1.0810 | bigbag | 2026-04-09 |
Отставание HYDRA от глобального SOTA: ~0.0046 BPB. Следующая волна — закрыть разрыв через v6.1 pipeline и новые прогоны.
Верифицированный рекорд форка: 1.06108 BPB (3 сида, post-TTT). Улучшение над baseline 1.0810: −0.01992 BPB. Цель v6.2: приблизиться к 1.0565.
| Seed | Steps | Post-TTT val BPB | Artifact bytes | Hardware |
|---|---|---|---|---|
| 42 | 4,945 | 1.05989 | 15,897,259 | 8× H100 SXM |
| 0 | 4,932 | 1.06125 | 15,900,947 | 8× H100 SXM |
| 1234 | 4,917 | 1.06209 | 15,907,550 | 8× H100 SXM |
| Mean ± σ | 4,931 | 1.06108 ± 0.00090 | 15,901,919 | 600s wallclock |
Record: records/track_10min_16mb/2026-04-27_SP8192_LQER_SparseGate_BOSSmearFix_9HpStack_1.0611
После участия в соревновании мы не остановились на рекорде. v6.1 — инженерная волна: из форка сделана платформа для следующих атак на лидерборд.
Форк openai/parameter-golf. Первые прогоны, records/, baseline 1.2244 → 1.08x.
LQER + SparseGate + SmearGate. 1.06108 BPB, 3-seed verified, ~15.9 MB artifact.
train_gpt.py, hydra_golf/, model.ptz, tests, CI, smoke/challenge profiles.
Закрыть gap 0.0046 BPB до SOTA 1.0565. Calib32 + AsymLogit lineage.
train_gpt.py без notebook-обёрткиmodel.ptz — ZIP, SHA-256, без picklehydra_golf/artifact.py11 layers, 512d, 8 GQA heads, 4 KV heads, 4× MLP, seq 2048, vocab 8192 BPE.
XSA on all layers, sparse attention gate, SmearGate with BOS mask, U-Net skips.
Depth recurrence on layers 3–5, partial RoPE + YaRN, parallel decoder from L8.
Polar-Express Newton-Schulz Muon, MIN_LR floor 0.10, fused softcapped CE kernel.
LQER asymmetric int4, per-group compression, greedy 1–8 bit allocation, GPTQ reserves.
3-seed protocol, post-load eval, submission.json with SHA-256 and exact byte count.
train_gpt.py — no notebook wrapperforward_logits() tensor axesmodel.ptz — ZIP, manifest, no pickle exechydra_golf/artifact.pyВерсионированный ZIP-артефакт с манифестом, payload и SHA-256 checksum. Загрузка не выполняет встроенный код и не использует pickle. Исходник модели возвращается как текст для инспекции.
Round-trip BPB после загрузки артефакта, точный размер в байтах, хеш, commit и метаданные прогона. Обязателен для любого competitive claim.
| Path | Purpose |
|---|---|
train_gpt.py | Main PyTorch entrypoint — smoke & challenge modes |
hydra_golf/ | Artifact serialization, metrics, safe loading |
records/ | Verified experiments with logs, seeds, submissions |
tests/ | Correctness tests for core utilities |
configs/ | Environment profiles (smoke / challenge) |
data/ | Dataset preparation utilities |
legacy/ | Historical scripts — reference only |
python -m pip install -r requirements.txt
python -m unittest discover -s tests -v
# Synthetic data — software check only
HYDRA_PROFILE=smoke ITERATIONS=2 MAX_SECONDS=15 python train_gpt.py
export HYDRA_PROFILE=challenge export DATA_PATH=./data/datasets/fineweb10B_sp8192 export TOKENIZER_PATH=./data/tokenizers/fineweb_8192_bpe.model export MAX_SECONDS=600 export TTT_ENABLED=0 torchrun --standalone --nproc_per_node=8 train_gpt.py
Конкурентный результат принимается только при выполнении всех условий:
Exact commit hash and full environment spec
Minimum 3 independent random seeds
Official tokenizer-aware validation BPB
Independent train and validation shards
Artifact ≤ 16,000,000 bytes — exact count
Post-load evaluation in clean process
Нет. Это исследовательский форк Evreu1pro с локально верифицированными записями. Для submission в оригинальное соревнование используйте протокол openai/parameter-golf.
Наш лучший стек (1.06108 BPB) соответствует ~5-му месту исторического лидерборда. Глобальный SOTA сейчас — 1.0565 BPB (May 2026). Отставание ~0.0046 BPB.
Нет. Это research target v6.2. Лучший включённый результат — 1.06108 BPB. Мы не заявляем необоснованный SOTA.
Инженерная платформа: безопасные артефакты, тесты, CI, smoke/challenge режимы, project site. Это база для следующих атак на 1.0565.
Нет. Smoke mode использует синтетические данные только для проверки софта.
Формат не использует pickle и не исполняет embedded code. Тем не менее, никогда не запускайте код из непроверенных артефактов.