Цифровая летопись казахского языка

06.09.2026

Согласно информации сайта Kazpravda.KZ, сообщает Qazaq24.com.

– Что представляет собой Нацио­нальный корпус казахского языка и в чем его принципиальное отличие от обычной электронной библиотеки?

– Это масштабная умная электронная база и цифровая летопись казахского языка. По существу, перед нами не электронный архив и не собрание словарей, а целостная модель языка, позволяющая увидеть слово в реальном употреблении, проследить его значение, грамматическую форму, сочетаемость и стилистическую принадлежность.

Сегодня общий объем корпуса составляет 250 миллионов словоупотреблений, объединенных в 22 подкорпуса. В корпус вошли современные и исторические тексты, образцы устной речи, материалы разных регионов, а также памятники, записанные кириллицей и арабской графикой, в том числе төте жаз.

Корпус нередко сравнивают с электронной библиотекой или обычным поиском в Интернете, однако есть важное отличие. Поисковая система находит совпадение, но не раскрывает устройство языка. В корпусе каждое слово снабжается специальными метаразметками, которые превращают большой массив текстов в научный ресурс и делают его пригодным для современных цифровых технологий.

– Кому на деле может помочь наличие такого корпуса?

– Главное его назначение – дать общест­ву достоверные знания о языке, чтобы установить, как употребляется слово, насколько оно распространено, в каких значениях и сочетаниях встречается, к какому времени, региону или стилю относится. На такой основе создаются словари, учебники, переводческие программы и другие языковые технологии.

Это особенно важно для лексикологов, грамматистов, диалектологов, терминологов, ономастов и составителей словарей. При этом поиск рассчитан не только на специалистов. Учитель найдет примеры для урока, студент сможет самостоятельно проанализировать материал, переводчик увидит устойчивые сочетания, а журналист или государственный служащий проверит норму и уместность термина.

Не менее важна культурная функция корпуса. Значительная часть лексики, связанной с традиционным бытом, обрядами и обычаями, уже не вполне понятна молодому поколению. Такие слова сопровождаются толкованиями, контекстами, иллюстрациями и видеоматериалами. Пользователь не просто читает незнакомое название, но и получает представление о стоящем за ним явлении. Сходный принцип применен и в ономастическом подкорпусе. Так сохраняются национальная память, конкретное знание о языке и культуре.

– Может ли корпус стать базовым ресурсом для искусственного интеллекта?

– Безусловно. Чем больше у языка качественных размеченных данных, тем увереннее с ним работают системы машинного перевода, поиска, распознавания и синтеза речи. Создание корпуса заметно укрепило цифровую базу казахского языка и приблизило его к категории среднересурсных.

Сегодня НККЯ – уже не проект на стадии становления, а действующая национальная корпусная система. Она продолжает пополняться и технологически развиваться, хотя научное и прикладное ядро уже сформировано.

Работают основной, устный, исторический, диалектный, параллельный, терминологический, учебный, ономастический и другие подкорпусы. Соб­раны произведения Ахмета Байтурсын­улы и других выдающихся деятелей и ученых, художественная литература, современная поэзия, пословицы, поговорки, фразеологизмы, а также современные и исторические рекламные тексты. Шестиязычный параллельный подкорпус позволяет сопоставлять казахские материалы с английскими, турецкими, узбекскими, уйгурскими и азербайджанскими версиями. Внутри экосистемы Института языкознания корпус связан с сервисами tbisozdik, tbi-emle, tbijazu, tbiocr, tbikitap, tbitezaurus. Все они работают на общей языковой базе. Материалы устной речи связаны с аудио и видео, исторические тексты из разных графических систем переводятся в форму, удобную для
поиска. Для англоязычной аудитории разработан Learner’s Corpus.

В апреле 2026 года были представлены корпус интернет-текстов объемом 100 миллионов словоупотреблений и подкорпус сгенерированных текстов объемом 50 миллионов. Теперь появилась возможность сопоставлять живую цифровую коммуникацию с текстами, созданными искусственным интеллектом, и видеть различия между ними.

За этими прикладными результатами стоит целая научная школа. Напомню: основы отечественной компьютерной и прикладной лингвистики были заложены профессором Аскаром Жубановым.

– На каком этапе корпус находится­ сейчас?

– Его можно определить как расширение, научную выверку и объединение ресурсов. Прежде главным результатом становился отдельный подкорпус или сервис. Теперь необходимо согласовать метаданные, принципы разметки и параметры поиска, повысить точность автоматического анализа и обеспечить работу всех компонентов как единой системы. Цифровизация здесь не относится к отдаленному будущему. Она уже заложена в самом устройстве НККЯ. Тексты машиночитаемы, размечены, доступны для автоматического поиска и связаны с цифровыми инструментами. Сегодня корпус постепенно становится национальной цифровой инфраструктурой казахского языка.

В цифровом пространстве быстро растет доля текстов, созданных нейросетями, тогда как подлинная речь людей зафиксирована далеко не полностью. Недостаточно представлены региональные и социальные варианты казахского языка, речь разных профессий, а также казахов, живущих за пределами страны. Уходит старшее поколение, и вместе с ним могут исчезнуть слова, интонации и формы повествования, которых нет в письменных источниках. Восстановить их позднее будет невозможно. Поэтому устный корпус необходимо расширять уже сейчас, включая бытовые разговоры, интервью, спонтанную речь и голоса разных поколений и регионов.

Только при регулярном пополнении НККЯ сохранит репрезентативность и будет соответствовать реальной языковой ситуации.

– Предвидится ли интеграция НККЯ с другими цифровыми платформами?

– Если судить непосредственно по нынешнему сайту, то интеграция корпуса в цифровые платформы началась. На главной странице уже находятся не только подкорпуса, но и целая система языковых инструментов. Материалы, собранные нашим институтом, а также пословицы, фразеологизмы и этномаркированная лексика с научными аннотациями переданы для работы над KazLLM. Эта работа ведется совместно с Казахским национальным университетом имени аль-Фараби и показывает, как фундаментальная лингвистика входит в современные технологии.

Принципиально важно, что Национальный корпус казахского языка дос­тупен бесплатно всем желающим. Открытая, научно проверенная текстовая база укрепляет присутствие казахского языка в цифровой среде и дает разработчикам материал для новых решений. В дальнейшем интеграция должна стать системной. Корпус необходимо связать с электронными словарями, образовательными платформами, переводческими программами, системами распознавания и синтеза речи. Ономастический подкорпус целесообразно соединить с электронной картой (GoogleMAP, 2GIS). Необходимы и открытые программные интерфейсы, через которые проверенные данные смогут получать другие цифровые продукты.

Стратегическое направление – соз­дание отечественного искусственного интеллекта, способного автономно работать на собственной языковой базе. Речь не идет об отказе от мировых сис­тем. Однако у страны должны быть и устойчивые национальные решения. На основе НККЯ можно создавать специализированные модели, в том числе цифрового помощника-лингвиста, который знает норму, историю слова, его сочетаемость и культурный контекст. Корпус нужен не только для обучения искусственного интеллекта. Он способен служить инструментом проверки, показывая, действительно ли предложенная форма употребляется в языке, насколько она частотна и в каких ситуа­циях уместна.

От того, насколько последовательно будет продолжена эта работа, зависит не только полнота научных исследований, но и способность казахского языка полноценно развиваться в цифровую эпоху.

Следите за обновлениями и свежими новостями на Qazaq24.com, где мы продолжаем следить за ситуацией и публиковать самую актуальную информацию.
Читать полностью