В датасеты, опубликованные на платформе Hugging Face, вошли: 78 часов аудиокниг (эпосы и кубаиры, проза, поэзия, народные сказки); 53 часа аудиозаписей теле- и радиопередач, 5 разговорников: башкирский / русский / казахский / алтайский / якутский / арабский / китайский.
Публикация на Hugging Face позволила сделать языковой корпус равнодоступным как для именитых фронтир-лабораторий, обучающих большие многоязычные модели на тысячах языков, так и разработчикам республики, школьном учителям, и студентам, работающим над дипломом без лишних бюрократических проволочек.
Специалистам министерства удалось с использованием передовых агентских технологий на базе LLM построить воспроизводимый «конвейер» обработки исходных материалов (представленных в различных форматах) в наборы данных, адаптированных для машинного обучения. Множество агентов действовало непосредственно в рабочей среде: читали файлы, писали и запускали код, автономно строили и проверяли гипотезы, предлагали изменения. Разница качественная: там, где прежде каждое правило выводилось умозрительно и проверялось выборочно, агент измерял его на всём корпусе, видел цену ошибки в числах и переписывал алгоритм за то время, которое прежде уходило только на постановку задачи.
Результат работы министерства не гигабайты, а «воспроизводимый конвейер» самостоятельно классифицирующий исходные данные (постранично определят изображения и текст в том числе для смешанных документов, параметры аудио), выполняющий распознавание (там, где текстового слоя нет) и смысловую сегментацию, «ремонт» кодировок (для человека незаметно, для машины это разные буквы), реконструкцию вёрстки (многоколоночные страницы, блочная вёрстка и табличная форма), «починку» переносов и разрывов строк, морфологический аудит, последующую сборку описания датасета и его финальную публикацию.
Конвейер не построен с чистого листа, в основе и многолетний труд по формализации башкирской орфографии Bashspell Айгиза Кунафина, морфологический анализатор, опубликованные Институтом истории, языка и литературы УФИЦ РАН «Грамматика современного башкирского литературного языка» и «Алгоритмическая грамматика словоизменения башкирского языка» использовались при автоматическом разборе каждого спорного случая.
Результаты возвращены сообществу, предложенные изменения приняты сопровождающими в публичных репозиториях исходных кодов apertium/apertium-bak и AigizK/bashspell, размещенных на GitHub. Это ровно тот случай, когда прикладной проект и языковое сообщество усиливают друг друга: сформирован обширный словарь корпуса, сообщество получило исправления, проверенные на объёме данных, которого прежде просто не существовало.
Современные модели уверенно говорят на малоресурсных языках, но именно из-за меньшей представленности в обучающих данных у генеративных моделей случается дрейф: башкирский текст незаметно съезжает в татарскую или казахскую морфологию, спецбуквы подменяются похожими, согласование по гармонии гласных ломается. Отдельная ценность — параллельные трёхъязычные разговорники: 9 857 фраз, выровненных с казахским, алтайским, якутским, арабским и китайским, редкий материал для машинного перевода внутри тюркской семьи, где путаница между родственными языками наиболее вероятна.
Опубликованный корпус — это основа для совершенствования технологий распознавания и синтеза речи, на которых строятся сервисы для граждан голосовые помощники, контакт-центры на башкирском, субтитрование и автоматический перевод республиканского вещания, клавиатуры и корректоры для смартфонов, образовательные сервисы: языковые тренажёры, интерактивные упражнения, адаптивные школьные программы.
Эпосы и кубаиры, начитанные в студии для незрячих читателей; подшивки республиканских газет и журналов; книги издательства «Китап». Оцифровка сама по себе сохраняет текст; машиночитаемый корпус сохраняет язык в форме, пригодной для того, чтобы на нём говорили технологии следующего десятилетия.
Публикация датасетов приурочена ко Дню языков народов России, который отмечается 8 сентября. Работа по расширению доступного языкового корпуса и открытых инструментов на его основе будет продолжена.