Международное общество «Қазақ тілі» и OpenAI создают цифровую языковую базу казахского языка, которая используется для обучения и оценки систем искусственного интеллекта, передает «24KZ».
Сегодня в Астане представили результаты этой работы. Текстовая база уже насчитывает 14 миллиардов токенов. Отметим, что это небольшая единица текста, на которые искусственный интеллект разбивает слова и предложения при обработке языка.
В корпус вошли материалы по истории казахского языка, языковое наследие и многое другое. Отдельно сформирован аудиокорпус – это 12 тысяч часов записей казахской речи. Материалы очищены от посторонних звуков, а специальная система автоматически переводит речь в текст. Точность такой транскрипции удалось довести до 98%.
Рауан Кенжеханулы, президент международного общества «Қазақ тілі»:
- Вместе с командой OpenAI на базе этих данных мы переобучаем такой продукт, как ChatGPT. Благодаря этому, система будет работать более глубоко, точно, особенно, когда это касается нашей истории, культуры, традиций, то есть тех данных, которых нет на других языках. Поэтому через такой инструмент мы помогаем не только нашим пользователям на казахском языке, но и другим пользователям, которые на других языках могут интересоваться нашей историей, культурой и традициями.
Теги #ChatGPT #обучение #казахский язык #искусственный интеллект #OpenAI #24 kz #Новости КазахстанаPhone: +7 (7172) 757 485
E-Mail: 24kz@khabar.kz