Evreu1pro / parameter-golf
v6.1.0 ● ACTIVE RESEARCH
OpenAI Parameter Golf · Research Fork

HYDRA GOLF

Сжать языковую модель до 16 мегабайт и обучить её за 600 секунд. Один артефакт. Жёсткий протокол. Многоголовая оптимизация — одна цель: минимальный BPB.

HYDRA Golf — не демо и не маркетинговый лендинг. Это исследовательская платформа для экстремального сжатия LLM: архитектура, квантование, расписание обучения и верификация результатов в одном репозитории. Форк соревнования OpenAI, доведённый до инженерной зрелости v6.1.

1.0565 Global SOTA (May 2026)
1.06108 HYDRA best BPB
−0.0199 vs 1.0810 baseline
v6.1 Engineering wave
01

Mission

Parameter Golf — открытое соревнование OpenAI: обучить наименьшую языковую модель, которая помещается в 16 MB и показывает лучший bits-per-byte (BPB) на валидации FineWeb. HYDRA Golf — исследовательский форк Evreu1pro, где каждый эксперимент документирован, воспроизводим и проверяется по строгому протоколу.

The constraint

  • Wall-clock budget: 10 minutes on challenge hardware
  • Serialized artifact: ≤ 16,000,000 bytes exactly
  • Metric: tokenizer-aware validation BPB
  • Evaluation: load artifact in a clean process, then score
  • Proof: 3+ seeds, mean ± std, logs and submission JSON

Why HYDRA

Гидра — метафора многофронтовой оптимизации. Отруби одну «голову» (квантование, архитектуру или schedule) — остальные всё равно тянут результат вперёд. Репозиторий хранит десятки верифицированных экспериментов в records/ и единый исполняемый entrypoint train_gpt.py.

PyTorch GPTQ GQA YaRN LQER MIT
02

Участие в соревновании

Мы участвуем в OpenAI Parameter Golf — форк Evreu1pro/parameter-golf хранит верифицированные прогоны, воспроизводимые записи и инженерную платформу HYDRA. Наш лучший стек попадает в топ исторического лидерборда.

Rank Run BPB Author Date
#1 Calib32 N-gram + AsymLogit Stack 1.0565 codemath3000 2026-05-01
#2 Progressive Context + Score-First TTT 1.0576 simonbissonnette 2026-04-30
#3 Long-Context No-Q/V TTT + QK 5.25 1.0586 andrewbaggio1 2026-04-30
#4 AWQ-Lite GPTQ + AsymLogit 1.0594 alertcat 2026-04-29
#5 SmearGate + LQER + SparseAttnGate + 9-Hparam 1.06108 HYDRA / codemath3000 stack 2026-04-27
3-Layer Recurrence baseline 1.0810 bigbag 2026-04-09

Отставание HYDRA от глобального SOTA: ~0.0046 BPB. Следующая волна — закрыть разрыв через v6.1 pipeline и новые прогоны.

03

Наш лучший результат

Верифицированный рекорд форка: 1.06108 BPB (3 сида, post-TTT). Улучшение над baseline 1.0810: −0.01992 BPB. Цель v6.2: приблизиться к 1.0565.

Global SOTA
1.0565
HYDRA best
1.06108
Old baseline
1.0810
Next target
<1.0540
Seed Steps Post-TTT val BPB Artifact bytes Hardware
42 4,945 1.05989 15,897,259 8× H100 SXM
0 4,932 1.06125 15,900,947 8× H100 SXM
1234 4,917 1.06209 15,907,550 8× H100 SXM
Mean ± σ 4,931 1.06108 ± 0.00090 15,901,919 600s wallclock

Record: records/track_10min_16mb/2026-04-27_SP8192_LQER_SparseGate_BOSSmearFix_9HpStack_1.0611

04

Новые силы — HYDRA v6.1JUL 2026

После участия в соревновании мы не остановились на рекорде. v6.1 — инженерная волна: из форка сделана платформа для следующих атак на лидерборд.

Mar 2026
Fork

Форк openai/parameter-golf. Первые прогоны, records/, baseline 1.2244 → 1.08x.

Apr 2026
Top-5 stack

LQER + SparseGate + SmearGate. 1.06108 BPB, 3-seed verified, ~15.9 MB artifact.

Jul 2026
v6.1 platform

train_gpt.py, hydra_golf/, model.ptz, tests, CI, smoke/challenge profiles.

Next
v6.2 strike

Закрыть gap 0.0046 BPB до SOTA 1.0565. Calib32 + AsymLogit lineage.

Что принесла v6.1

  • Исполняемый train_gpt.py без notebook-обёртки
  • Безопасный model.ptz — ZIP, SHA-256, без pickle
  • Реальное 1–8 bit packing в hydra_golf/artifact.py
  • Tokenizer-aware BPB — метрики как на лидерборде
  • Unit tests + GitHub Actions CI + Pages deploy

Что в разработке

  • Интеграция Calib32 / AsymLogit стека из PR #2135 lineage
  • Автоматический 3-seed compliance runner
  • Обновление records/ под v6.1 artifact format
  • Ablations: head gating, Mobius recurrence, TTT protocol
  • Публичный project site + docs (этот сайт)
05

Architecture stack

HEAD I

Core GPT

11 layers, 512d, 8 GQA heads, 4 KV heads, 4× MLP, seq 2048, vocab 8192 BPE.

HEAD II

Attention mods

XSA on all layers, sparse attention gate, SmearGate with BOS mask, U-Net skips.

HEAD III

Depth & RoPE

Depth recurrence on layers 3–5, partial RoPE + YaRN, parallel decoder from L8.

HEAD IV

Optimizer

Polar-Express Newton-Schulz Muon, MIN_LR floor 0.10, fused softcapped CE kernel.

HEAD V

Quantization

LQER asymmetric int4, per-group compression, greedy 1–8 bit allocation, GPTQ reserves.

HEAD VI

Verification

3-seed protocol, post-load eval, submission.json with SHA-256 and exact byte count.

v6.1 engineering upgrades

  • Executable train_gpt.py — no notebook wrapper
  • Smoke vs challenge profiles with explicit failure modes
  • Tokenizer-aware BPB utilities
  • Fixed forward_logits() tensor axes
  • Safe model.ptz — ZIP, manifest, no pickle exec
  • Real 1–8 bit packing in hydra_golf/artifact.py
  • Unit tests + CI pipeline
  • TTT disabled by default (evaluator-gated)
06

Artifact format

model.ptz

Версионированный ZIP-артефакт с манифестом, payload и SHA-256 checksum. Загрузка не выполняет встроенный код и не использует pickle. Исходник модели возвращается как текст для инспекции.

submission.json

Round-trip BPB после загрузки артефакта, точный размер в байтах, хеш, commit и метаданные прогона. Обязателен для любого competitive claim.

07

Repository map

PathPurpose
train_gpt.pyMain PyTorch entrypoint — smoke & challenge modes
hydra_golf/Artifact serialization, metrics, safe loading
records/Verified experiments with logs, seeds, submissions
tests/Correctness tests for core utilities
configs/Environment profiles (smoke / challenge)
data/Dataset preparation utilities
legacy/Historical scripts — reference only
08

Quick start

Smoke test (local, safe)

python -m pip install -r requirements.txt
python -m unittest discover -s tests -v
# Synthetic data — software check only
HYDRA_PROFILE=smoke ITERATIONS=2 MAX_SECONDS=15 python train_gpt.py

Challenge-shaped run

export HYDRA_PROFILE=challenge
export DATA_PATH=./data/datasets/fineweb10B_sp8192
export TOKENIZER_PATH=./data/tokenizers/fineweb_8192_bpe.model
export MAX_SECONDS=600
export TTT_ENABLED=0
torchrun --standalone --nproc_per_node=8 train_gpt.py
09

Acceptance gates

Конкурентный результат принимается только при выполнении всех условий:

01

Exact commit hash and full environment spec

02

Minimum 3 independent random seeds

03

Official tokenizer-aware validation BPB

04

Independent train and validation shards

05

Artifact ≤ 16,000,000 bytes — exact count

06

Post-load evaluation in clean process

10

FAQ

Это официальный лидерборд OpenAI?

Нет. Это исследовательский форк Evreu1pro с локально верифицированными записями. Для submission в оригинальное соревнование используйте протокол openai/parameter-golf.

Где мы на лидерборде?

Наш лучший стек (1.06108 BPB) соответствует ~5-му месту исторического лидерборда. Глобальный SOTA сейчас — 1.0565 BPB (May 2026). Отставание ~0.0046 BPB.

Достигнут ли BPB < 1.0540?

Нет. Это research target v6.2. Лучший включённый результат — 1.06108 BPB. Мы не заявляем необоснованный SOTA.

Что нового в v6.1?

Инженерная платформа: безопасные артефакты, тесты, CI, smoke/challenge режимы, project site. Это база для следующих атак на 1.0565.

Можно ли сравнивать smoke BPB с лидербордом?

Нет. Smoke mode использует синтетические данные только для проверки софта.

Безопасно ли открывать model.ptz?

Формат не использует pickle и не исполняет embedded code. Тем не менее, никогда не запускайте код из непроверенных артефактов.