18+
Новости Актау и Мангыстау
Ақтау және Манғыстау жаңалықтары
04.09.2026, 07:11

ChatGPT отправили на большой урок казахского: счет пошел на миллиарды

ChatGPT хотят научить глубже понимать казахский язык и точнее отвечать на вопросы, связанные с историей, культурой и традициями Казахстана. Для обучения искусственного интеллекта собирают миллиарды токенов текстовых, аудио- и других данных, сообщает Lada.kz со ссылкой на Kazinform.

Изображение создано Lada.kz с помощью ИИ (ChatGPT/OpenAI)
Изображение создано Lada.kz с помощью ИИ (ChatGPT/OpenAI)

Для ChatGPT собрали миллиарды токенов

О работе над улучшением казахского языка в ChatGPT рассказал президент Международного общества «Қазақ тілі» Рауан Кенжеханулы. По его словам, организация тесно сотрудничает с компанией OpenAI.

Для работы с казахским языком потребовался значительный объем данных — тексты, аудиозаписи, изображения и другие материалы. Сбором необходимой информации занялись казахстанские специалисты.

«Мы тесно сотрудничаем с компанией OpenAI в этом направлении. Для работы им потребовался большой объем данных на казахском языке — в виде текстов, аудиофайлов и других материалов. Мы взяли эту работу на себя. Если говорить техническим языком, собрано более 10 млрд токенов. Это могут быть самые разные тексты на казахском языке, аудиофайлы, изображения. Теперь благодаря этим данным мы заново обучаем ChatGPT», — рассказал Рауан Кенжеханулы.

Что вошло в огромную языковую базу

Параллельно специалисты продолжают формировать массив текстовых и аудиоданных на казахском языке. Объем текстовой базы Kazakh Text Corpus уже достиг 14 млрд токенов.

При ее создании решили не ограничиваться современными публикациями из интернета. В корпус включают материалы разных периодов развития казахского языка, а также языковое наследие казахской диаспоры за рубежом.

Информация систематизируется по темам, жанрам и возрастным категориям. База охватывает образование, науку, технологии, экономику, право, медицину, историю, этнографию, средства массовой информации и детский контент.

Таким образом разработчики получают не просто большой массив казахоязычных текстов, а структурированную базу, отражающую использование языка в самых разных сферах.

Зачем ChatGPT понадобилось столько данных

Одна из главных целей проекта — сделать работу искусственного интеллекта на казахском языке более точной.

Ожидается, что дополнительные данные помогут улучшить перевод, обработку информации и ответы на вопросы. Особое внимание уделяется темам, связанным с казахским языком, культурой, традициями и историей.

«Благодаря этому ChatGPT должен стать более качественным инструментом для перевода и работы с информацией на казахском языке. В том числе, что особенно важно для нас, он должен точнее отвечать на вопросы, связанные с казахской культурой, языком, традициями и историей, без ошибок и так называемых "галлюцинаций". Поэтому в ближайшее время ChatGPT и другие подобные инструменты искусственного интеллекта должны начать работать на казахском языке гораздо глубже, качественнее и точнее», — отметил Кенжеханулы.

Под «галлюцинациями» применительно к искусственному интеллекту обычно понимают ситуации, когда модель выдает недостоверную или вымышленную информацию как правдоподобный ответ.

Почему с казахским языком сложнее

Одной из основных проблем остается сравнительно небольшой объем казахоязычного контента, который можно использовать при создании и совершенствовании ИИ-систем.

По словам Рауана Кенжеханулы, современные языковые модели во многом зависят от количества информации, ранее созданной на конкретном языке и доступной в цифровом виде.

«Любая ИИ-модель в первую очередь опирается на данные, которые ранее были созданы на этом языке и размещены в интернете. По сравнению с английским или русским языком объем данных на казахском значительно меньше», — объяснил глава общества.

Материалы ищут в архивах, музеях и библиотеках

Чтобы увеличить объем качественного казахоязычного контента, специалисты обращаются не только к материалам, доступным в интернете.

Данные собирают в архивах, музеях, библиотеках и других источниках. После получения необходимых разрешений материалы систематизируют и объединяют в специальные массивы, которые могут использоваться при работе с искусственным интеллектом.

Ожидается, что расширение базы поможет не только повысить качество текстовых ответов ChatGPT на казахском языке, но и улучшить работу технологий с текстами, аудиозаписями и человеческой речью.

Нравится 1
Не нравится 0
Нейтрально 0
Подпишись на наш канал в Telegram
– быстро, бесплатно и без рекламы
Подписаться

Комментарии

0 комментарий(ев)
Комментарии могут оставлять только зарегистрированные пользователи. Зарегистрируйтесь либо, авторизуйтесь. Содержание комментариев не имеет отношения к редакционной политике Лада.kz.Редакция не несет ответственность за форму и характер комментариев, оставляемых пользователями сайта.