openbmb/Ultra-FineWeb
Viewer • Updated • 1.29B • 76.5k • 449
16000 vocab size tokenizer padded to 16384, trained on the following data:
DATASETS = [
("mlfoundations/dclm-baseline-1.0-parquet", None, "train", "text", 75000),
("HuggingFaceFW/finepdfs-edu", "eng_Latn", "train", "text", 5000),
("openbmb/Ultra-FineWeb", None, "zh", "content", 25000),
("openbmb/UltraData-Code", "UltraData-Code-L2", "cpp", "content", 10000),
("openbmb/UltraData-Code", "UltraData-Code-L2", "js", "content", 10000),
("openbmb/UltraData-Code", "UltraData-Code-L2", "py", "content", 10000),
("openbmb/UltraData-Code", "UltraData-Code-L2", "rust", "content", 10000),
("openbmb/UltraData-Math", "UltraData-Math-L2-preview", "train", "content", 20000),
]
Code is in notebook.py