{ "description": "Held-out corpus for the Escha KLD measurement \u2014 the exact token ids the teacher and every student were scored on.", "n_sequences": 256, "seq_len": 2048, "n_scored_positions": 524032, "sha256_input_ids": "1df18b3494765055ec07992abdc40c7f907fb2f8d87a0bc338ce853b19fb6033", "tokenizer": "/home/yzh/Desktop/Qwen3.6-35B-A3B-bf16", "sources_spec": "wikitext2:96,c4:96,code:64", "per_sequence_source": [ "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "wikitext2", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "c4", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code", "code" ], "seed": 0, "dataset_revisions": { "Salesforce/wikitext (wikitext-2-raw-v1, test)": "b08601e04326c79dfdd32d625aee71d232d685c3", "allenai/c4 (en, validation)": "1588ec454efa1a09f29cd18ddd04fe05fc8653a2", "codeparrot/codeparrot-clean-valid (train)": "4db92d2ec0c1b4c41eeb439cfae16854511d9dcd" }, "position_convention": "row s of the teacher cache is the distribution over token s+1, computed from logits at position s; students index identically", "note": "Scoring reads these ids directly \u2014 no tokenizer is invoked at scoring time, so both the transformers and llama.cpp arms see byte-identical positions." }