--- license: mit language: - kk metrics: - wer base_model: - openai/whisper-large-v3 pipeline_tag: automatic-speech-recognition library_name: transformers tags: - kazakh - tilqazyna extra_gated_prompt: >- Бұл репозиторийге қолжетімділік өтінім бойынша беріледі. Өзіңіз туралы және деректерді қалай қолданатыңыз туралы жазыңыз — өтінімді TilQazyna командасы қарайды. · Доступ к репозиторию выдаётся по заявке. Расскажите о себе и о том, как собираетесь использовать данные — заявку рассматривает команда TilQazyna. · Access to this repository is granted on request. Tell us who you are and how you plan to use the material; the TilQazyna team reviews each application. extra_gated_fields: Аты-жөні / ФИО / Full name: text Ұйым / Организация / Affiliation: text Мақсаты / Цель использования / Intended use: text --- # tq-large-kaz-1 Қазақ сөзін тануға бейімделген Whisper Large v3 · Whisper Large v3 для распознавания казахской речи · Whisper Large v3 adapted for Kazakh speech recognition **[Қазақша](#қазақша) · [Русский](#русский) · [English](#english)** --- ## Қазақша **tq-large-kaz-1** — қазақша аудионы мәтінге айналдыруға бейімделген Whisper Large v3 ASR моделі. Репозиторий көлемі — 6.18 ГБ; бағалау жиынындағы WER көрсеткіші 8.51%. ### Құрылымы | Сипаттама | Мәні | |---|---| | Архитектура | `WhisperForConditionalGeneration` | | Негізгі модель | `openai/whisper-large-v3` | | Қабат саны | 32 | | Сөздік көлемі | 51866 | | Салмақ пішімі | safetensors | Салмақтар 2 safetensors бөлігіне бөлінген және индекс файлымен бірге жарияланған. Tokenizer, normalizer және аудионы алдын ала өңдеу конфигурациялары сол репозиторийде сақталған. Бұл файлдар Transformers арқылы тікелей жүктеуге жеткілікті. ### Оқыту және бағалау Модель `audio2`, `audio3` және `audio4` деректерінде fine-tune жасалған. Оқыту мен бағалау үлесі 97% және 3% болып бөлінген. | Параметр | Мәні | |---|---:| | Batch size | 32 | | Gradient accumulation | 2 | | Learning rate | 1e-5 | | Warmup қадамы | 500 | | Max қадам | 8000 | | Дәлдік | FP16 | | Бағалау метрикасы | WER 8.51% | Аудио 16 kHz жиілікке келтіріліп, log-Mel белгілері Whisper feature extractor арқылы алынған. Транскрипттер қазақ тілі баптауы бар Whisper tokenizer көмегімен өңделген. ### Іске қосу ```python from transformers import pipeline asr = pipeline( "automatic-speech-recognition", model="TilQazyna/tq-large-kaz-1", ) result = asr("input.wav", generate_kwargs={"language": "kazakh"}) print(result["text"]) ``` Код жергілікті `input.wav` файлын таниды; модельді жүктеу үшін алдын ала рұқсат берілген Hugging Face тіркелгісі қажет. ### Қолжетімділік Карточка мен файлдардың тізімі ашық көрінеді. Салмақтарды жүктеу «Request access» өтінімін TilQazyna командасы мақұлдағаннан кейін ашылады. ### Байланысты репозиторийлер Шағын нұсқасы — [tq-small-kaz-1](https://huggingface.co/TilQazyna/tq-small-kaz-1). Бағдарламадағы аудио деректер [Til-Audio](https://huggingface.co/datasets/TilQazyna/Til-Audio) жинағында берілген. --- ## Русский **tq-large-kaz-1** — модель ASR Whisper Large v3, дообученная для транскрибирования казахской речи. Репозиторий занимает 6.18 ГБ; WER на оценочной выборке — 8.51%. ### Устройство | Характеристика | Значение | |---|---| | Архитектура | `WhisperForConditionalGeneration` | | Базовая модель | `openai/whisper-large-v3` | | Слоёв | 32 | | Размер словаря | 51866 | | Формат весов | safetensors | Веса разделены на 2 файла safetensors и опубликованы вместе с индексом. В репозитории также лежат tokenizer, normalizer и конфигурация предобработки аудио. ### Обучение и оценка Модель прошла fine-tune на данных `audio2`, `audio3` и `audio4`. Данные разделили на обучающую и оценочную части в пропорции 97% и 3%. | Параметр | Значение | |---|---:| | Batch size | 32 | | Gradient accumulation | 2 | | Learning rate | 1e-5 | | Шагов warmup | 500 | | Max steps | 8000 | | Точность | FP16 | | Метрика оценки | WER 8.51% | Аудио приводили к частоте 16 kHz, затем Whisper feature extractor извлекал log-Mel признаки. Транскрипты обрабатывал Whisper tokenizer с настройкой казахского языка. ### Как запустить ```python from transformers import pipeline asr = pipeline( "automatic-speech-recognition", model="TilQazyna/tq-large-kaz-1", ) result = asr("input.wav", generate_kwargs={"language": "kazakh"}) print(result["text"]) ``` Код распознаёт локальный файл `input.wav`; для загрузки модели нужна учётная запись Hugging Face с одобренным доступом. ### Доступ Карточка и список файлов видны всем. Веса становятся доступны после заявки через «Request access» и её одобрения командой TilQazyna. ### Связанные репозитории Меньшая версия модели опубликована как [tq-small-kaz-1](https://huggingface.co/TilQazyna/tq-small-kaz-1). Аудиоданные программы находятся в [Til-Audio](https://huggingface.co/datasets/TilQazyna/Til-Audio). --- ## English **tq-large-kaz-1** is a Whisper Large v3 ASR model fine-tuned to transcribe Kazakh speech. The repository occupies 6.18 GB, and the reported WER on the evaluation split is 8.51%. ### Architecture | Characteristic | Value | |---|---| | Architecture | `WhisperForConditionalGeneration` | | Base model | `openai/whisper-large-v3` | | Layers | 32 | | Vocabulary size | 51866 | | Weight format | safetensors | The weights are split across 2 safetensors files and accompanied by an index. The repository also supplies the tokenizer, normalizer, and audio preprocessing configuration. ### Training and evaluation The model was fine-tuned on the `audio2`, `audio3`, and `audio4` data sources. The combined data was divided into 97% training and 3% evaluation splits. | Setting | Value | |---|---:| | Batch size | 32 | | Gradient accumulation | 2 | | Learning rate | 1e-5 | | Warmup steps | 500 | | Max steps | 8000 | | Precision | FP16 | | Evaluation metric | WER 8.51% | Audio was resampled to 16 kHz before the Whisper feature extractor produced log-Mel features. Transcripts were processed with the Whisper tokenizer configured for Kazakh. ### Inference ```python from transformers import pipeline asr = pipeline( "automatic-speech-recognition", model="TilQazyna/tq-large-kaz-1", ) result = asr("input.wav", generate_kwargs={"language": "kazakh"}) print(result["text"]) ``` The example transcribes a local `input.wav` file. Loading the model requires a Hugging Face account with approved access. ### Access The repository card and file listing remain visible to everyone. Weight downloads open after the TilQazyna team approves an application submitted through “Request access.” ### Related repositories The smaller model is available as [tq-small-kaz-1](https://huggingface.co/TilQazyna/tq-small-kaz-1). Program audio data is published in [Til-Audio](https://huggingface.co/datasets/TilQazyna/Til-Audio). --- Лицензия · License: mit · [TilQazyna](https://huggingface.co/TilQazyna)