Қазақ тілінің цифрлық қоры кеңейіп, транскрипция дәлдігі 98% ға жетті
Qazaq24.com, Aikyn.KZ дереккөзінен алынған ақпаратқа сүйене отырып жаңалық таратты..
Астанада Халықаралық «Қазақ тілі» қоғамы мен OpenAI компаниясының қазақ тілін цифрлық кеңістікте дамытуға бағытталған бірлескен жобасының нәтижелері таныстырылды. Жоба аясында қазақ тілінің мәтіндік корпусы 14 миллиард токенге, аудиодеректер қоры 12 мың сағатқа жетті. Қазақ тіліне бейімделген транскрипция модельдерінің дәлдігі 98%-ға дейін артты, – деп хабарлайды Aikyn.kz.
Astana Hub-та өткен жиынға Халықаралық «Қазақ тілі» қоғамының президенті Рауан Кенжеханұлы, «Қазақтелеком» АҚ Басқарма төрағасы Бағдат Мусин, Қоғам құрылтайшылары, Орталық кеңес мүшелері мен депутаттар, IT-сарапшылар мен тіл мамандары қатысты.
Халықаралық «Қазақ тілі» қоғамы мен OpenAI арасындағы ауқымды бастама 2025 жылғы 7 қарашада Вашингтонда жасалған келісім аясында жүзеге асып келеді. Жобаның басты мақсаты – сапалы цифрлық контент пен сенімді деректер қорын қалыптастыру арқылы үлкен тіл модельдерінің (LLM) қазақ тіліндегі жұмыс сапасын арттыру.
«Біздің мақсатымыз – қазақ тілінің жасанды интеллект дәуірінде толыққанды қолданылуына жағдай жасау. Ол үшін тілдің бай қорын цифрлық ортаға енгізумен қатар, жасанды интеллектінің қазақ тілін табиғи түсінуі, дұрыс қолдануы және ұлттық мәдени контексті ескеруі маңызды. Сондықтан біз дерек қорын қалыптастырумен ғана шектелмей, оның сапасына және тіл модельдерін бағалау құралдарына да ерекше мән беріп отырмыз. Бұл – бір реттік жоба емес, жүйелі әрі ұзақмерзімді жұмыс», – деді Халықаралық «Қазақ тілі» қоғамының президенті Рауан Кенжеханұлы.
Жоба аясында қазақ тіліндегі мәтін мен сөйлеу деректерінің сапалы корпусы жинақталып, соның негізінде жасанды интеллект құралдары әзірленіп жатыр. Қазақ тілінің мәтіндік корпусы (Kazakh Text Corpus) 14 миллиард токенге жетті. Ондағы материалдар тақырып, жанр және жас ерекшеліктері бойынша жіктелген. Корпусқа қазақ тілінің тарихи даму кезеңдерін қамтитын мазмұнмен бірге шетелдегі қазақ диаспорасының тілдік мұрасы да енгізілді. Қор білім, ғылым, технология, экономика, құқық, медицина, тарих, этнография, медиа және балалар контентін түгел қамтиды.
Аудиодеректер қоры 12 мың сағаттан тұрады. Барлық жазба сыртқы шу, музыка және басқа да артық дыбыстардан тазартылды. Сонымен қатар қазақ тіліне бейімделген транскрипция модельдері қолданысқа енгізіліп, мәтінге айналдыру дәлдігі 98%-ға дейін жеткізілді.
«Жасанды интеллект бағытындағы жүйелі жұмысты бастағанда алдымызда маңызды сұрақ тұрды: біздің жасанды интеллект қай тілде “ойлауы” керек? Дайын шетелдік модельдер ағылшын және орыс тілдерінде біршама жақсы жұмыс істейді. Алайда қазақ тілін, әсіресе оның іскерлік, құқықтық және техникалық қабатын сапалы түсіну деңгейі әлі де жеткіліксіз. Бұл мәселе шешілмесе, цифрлық трансформация кезінде қазақ тілі технология мен мемлекеттік басқару тіліне айнала алмай, тұрмыстық қолданыс аясында қалып қою қаупі бар. Сондықтан біз қазақ тілі жасанды интеллектінің толыққанды әрі табиғи жұмыс ортасы болуы керек деген ұстанымға келдік», – деді «Қазақтелеком» АҚ Басқарма төрағасы Бағдат Мусин.
Жобаның басым бағыттарының бірі – жеке деректерді қорғау. Осы мақсатта мәтін мен аудиодеректерден жеке ақпаратты автоматты түрде анықтап, тазартатын арнайы модель әзірленді. Оның көмегімен 14 миллиардтан астам токеннен тұратын мәтіндік корпус пен 12 мың сағаттық аудиодеректердегі жеке ақпарат толықтай тазартылды.
Сонымен қатар қазақ тіліне арналған Document AI және NLP (табиғи тілді өңдеу) құралдары жасалды. Олардың қатарында қазақ тіліндегі мәтінді жоғары дәлдікпен танитын OCR жүйесі, газет, кітап және PDF құжаттарының құрылымын ажырату, көпбағанды беттерді дұрыс ретпен оқу, токенизация, NER (атаулы нысандарды анықтау) және деректерді тазарту тетіктері бар. Бұл технологиялар архивтік материалдар мен оқулықтарды цифрландыруға, сондай-ақ қазақ тіліндегі цифрлық мазмұнды іздеу мен өңдеу сапасын жақсартуға мүмкіндік береді.
Бұған дейін жасанды интеллект жүйелерінің қазақ тілін меңгеру деңгейін тексеруге арналған AI Evaluation Benchmark Suite бағалау жүйесі әзірленген еді. Ол үлкен тіл модельдерін мәтінді түсіну (Reading Comprehension), грамматика (Grammar), тілдің табиғилығы (Kazakh Language Naturalness), мақал-мәтелдер мен тұрақты тіркестерді қолдану (Proverbs & Idioms), академиялық аударма (Academic Translation), қазақ тілінен ағылшын тіліне көркем аударма (Literary Translation), балалар әдебиетінің аудармасы (Kids Literature Translation), қауіпсіздік (Safety) және этнографиялық білім (Ethnography) бағыттары бойынша сынайды. Бағалау жүйесі ағылшын тілінен аударылмай, қазақ тілінің тілдік және мәдени ерекшеліктерін ескере отырып, тікелей қазақ тілінде құрастырылды.
Қазіргі уақытта AI Evaluation Benchmark Suite жүйесінің этнографиялық білімді (Ethnography) бағалау бағыты кеңейтіліп, 500 сұрақтан тұратын толыққанды бенчмарк әзірленді. Ол үлкен тіл модельдерінің қазақ халқының тарихы, салт-дәстүрі мен мәдениетіне қатысты білімін бағалауға мүмкіндік береді. Бенчмарк сынағынан өткен GPT-5.6 Terra моделінің дәлдік көрсеткіші 35,92%-ды құрады. Алдағы уақытта этнографиялық бенчмаркті ғылыми қоғамдастыққа қолжетімді ету жоспарланып отыр. Бұл оны өзге де тіл модельдерін бағалау құралы ретінде пайдалануға жол ашады.
Халықаралық «Қазақ тілі» қоғамы мен OpenAI серіктестігі аясында қазақ тіліндегі мәтіндік және дыбыстық деректер қорын кеңейту, олардың сапасын арттыру, жеке деректерді қорғау және жасанды интеллект модельдерін бағалау құралдарын жетілдіру жұмыстары алдағы уақытта да жалғасады.
Бұл тақырыптағы басқа жаңалықтар:
Көрілімдер:20
Бұл хабарлама дереккөзден мұрағатталған 03 Қыркүйек 2026 19:09 



Кіру
Жаңалықтар
Ауа райы
Магниттік дауылдар
Намаз уақыты
Қымбат металдар
Валюта конвертері
Кредит есептегіш
Криптовалюта бағамы
Жұлдыздар
Сұрақ - Жауап
Интернет жылдамдығын тексеріңіз
Қазақстан радиосы
Қазақстан телевизиясы
Біз туралы








Ең көп оқылғандар


















