conversations
Кейс: масштабная локализация ИТ-инфраструктуры для международного производителя медицинских изделий
Кейс: разработка и внедрение ИИ агента для проверки документов контрагентов в табачном ритейле
Ирина Меженева («Газинформсервис»): «ИИ не породил принципиально новых типов атак, но качественно изменил уже существующие»
Как считать ROI ИИ по каждому контуру, а не по компании в целом
Сотовые тарифы в Казани в 2026 году
ЦБ
°
пятница, 11 сентября 2026

Запущен официальный открытый корпус башкирского языка Bashkorttele

Комиссия по сохранению языков народов Башкортостана, которую возглавляет первый вице-премьер Урал Кильсенбаев, объявила о публикации серии языковых датасетов Bashkorttele. Их подготовил Фонд сохранения и развития башкирского языка. Об этом сообщает сайт Министерства цифрового развития государственного управления республики Башкортостан.

В датасеты, опубликованные на платформе Hugging Face, вошли: 78 часов аудиокниг (эпосы и кубаиры, проза, поэзия, народные сказки); 53 часа аудиозаписей теле-  и радиопередач, 5 разговорников: башкирский / русский / казахский / алтайский / якутский / арабский / китайский.

Публикация на Hugging Face позволила сделать языковой корпус равнодоступным как для именитых фронтир-лабораторий, обучающих большие многоязычные модели на тысячах языков, так и разработчикам республики, школьном учителям, и студентам, работающим над дипломом без лишних бюрократических проволочек.

Специалистам министерства удалось с использованием передовых агентских технологий на базе LLM построить воспроизводимый «конвейер» обработки исходных материалов (представленных в различных форматах) в наборы данных, адаптированных для машинного обучения. Множество агентов действовало непосредственно в рабочей среде: читали файлы, писали и запускали код, автономно строили и проверяли гипотезы, предлагали изменения. Разница качественная: там, где прежде каждое правило выводилось умозрительно и проверялось выборочно, агент измерял его на всём корпусе, видел цену ошибки в числах и переписывал алгоритм за то время, которое прежде уходило только на постановку задачи.

Результат работы министерства не гигабайты, а «воспроизводимый конвейер» самостоятельно классифицирующий исходные данные (постранично определят изображения и текст в том числе для смешанных документов, параметры аудио), выполняющий распознавание (там, где текстового слоя нет) и смысловую сегментацию, «ремонт» кодировок (для человека незаметно, для машины это разные буквы), реконструкцию вёрстки (многоколоночные страницы, блочная вёрстка и табличная форма), «починку» переносов и разрывов строк, морфологический аудит, последующую сборку описания датасета и его финальную публикацию.

Конвейер не построен с чистого листа, в основе и многолетний труд по формализации башкирской орфографии Bashspell Айгиза Кунафина, морфологический анализатор, опубликованные Институтом истории, языка и литературы УФИЦ РАН «Грамматика современного башкирского литературного языка» и «Алгоритмическая грамматика словоизменения башкирского языка» использовались при автоматическом разборе каждого спорного случая.

Результаты возвращены сообществу, предложенные изменения приняты сопровождающими в публичных репозиториях исходных кодов apertium/apertium-bak и AigizK/bashspell, размещенных на GitHub. Это ровно тот случай, когда прикладной проект и языковое сообщество усиливают друг друга: сформирован обширный словарь корпуса, сообщество получило исправления, проверенные на объёме данных, которого прежде просто не существовало.

Современные модели уверенно говорят на малоресурсных языках, но именно из-за меньшей представленности в обучающих данных у генеративных моделей случается дрейф: башкирский текст незаметно съезжает в татарскую или казахскую морфологию, спецбуквы подменяются похожими, согласование по гармонии гласных ломается. Отдельная ценность — параллельные трёхъязычные разговорники: 9 857 фраз, выровненных с казахским, алтайским, якутским, арабским и китайским, редкий материал для машинного перевода внутри тюркской семьи, где путаница между родственными языками наиболее вероятна.

Опубликованный корпус — это основа для совершенствования технологий распознавания и синтеза речи, на которых строятся сервисы для граждан голосовые помощники, контакт-центры на башкирском, субтитрование и автоматический перевод республиканского вещания, клавиатуры и корректоры для смартфонов, образовательные сервисы: языковые тренажёры, интерактивные упражнения, адаптивные школьные программы.

Эпосы и кубаиры, начитанные в студии для незрячих читателей; подшивки республиканских газет и журналов; книги издательства «Китап». Оцифровка сама по себе сохраняет текст; машиночитаемый корпус сохраняет язык в форме, пригодной для того, чтобы на нём говорили технологии следующего десятилетия.

Публикация датасетов приурочена ко Дню языков народов России, который отмечается 8 сентября. Работа по расширению доступного языкового корпуса и открытых инструментов на его основе будет продолжена.

 

Свежее по теме