На базе казахского языка планируют развивать собственные AI-модели
Цифровая эпоха принципиально меняет задачи стоящие перед лингвистами
Казахский язык должен перейти из категории языков с ограниченным объемом цифровых ресурсов в число, полноценно представленных в цифровой среде. Для этого необходимы не только словари и академические исследования, но и большие массивы качественных языковых данных, Национальный корпус, NLP-инструменты и собственные языковые модели. Об этом на брифинге Региональной службы коммуникаций рассказала генеральный директор Института языкознания имени Ахмета Байтурсынова, кандидат филологических наук Анар Фазылжан, - передает Almaty.tv.
По словам спикера, цифровая эпоха принципиально меняет задачи, стоящие перед лингвистами. Если раньше языкознание прежде всего описывало устройство языка, разрабатывало грамматики и словари, то сегодня язык необходимо еще и «научить» взаимодействовать с машиной - обеспечить его качественными цифровыми данными, без которых невозможно развитие искусственного интеллекта.
«Казахское языкознание больше не может ограничиваться только академическими описаниями, словарями и грамматиками. Сегодня необходимы языковые корпуса, базы данных, аннотированные тексты, цифровые словари, NLP-инструменты, языковые модели и продукты искусственного интеллекта. Нам необходимо ускорить переход казахского языка от уровня low-resource language к high-resource language и расширять сферу его использования в цифровой среде», - отметила Анар Фазылжан.
Одной из главных основ для такой работы становится Национальный корпус казахского языка. Сегодня его объем достиг 200 миллионов словоупотреблений. В его составе действуют 22 специализированных подкорпуса, охватывающих устную речь, диалекты, терминологию, учебные и научные тексты, современную поэзию, интернет-контент, тексты, созданные искусственным интеллектом, и другие языковые пласты.
Параллельно Институт переводит в цифровой формат и другие лингвистические ресурсы. Пользователям уже доступны более 30 продуктов: электронные словари, инструменты проверки орфографии, пунктуации и стилистики, OCR для распознавания текста, сервисы морфологического анализа, поиска синонимов и проверки орфоэпических норм. Оцифрован и картотечный фонд объемом 4,5 млн единиц, сформированный на основе достоверных языковых контекстов.
Особое значение эти ресурсы приобретают с развитием больших языковых моделей. Институт языкознания определен координирующей организацией по созданию и развитию Национального корпуса казахского языка и вместе с КазНУ имени аль-Фараби участвует в мегапроекте по разработке большой языковой модели для казахского языка.
«Эпоха больших языковых моделей ставит перед нами новую задачу: язык нужно не только исследовать, но и адаптировать к системам искусственного интеллекта. Казахский язык должен быть полноценно представлен в таких моделях. При этом для национальной безопасности особенно важно развивать собственные отечественные и отраслевые системы искусственного интеллекта», - подчеркнула руководитель Института.
В перспективе речь может идти не только об универсальных языковых моделях, но и о специализированных казахоязычных AI-системах. Одним из таких проектов, по мнению ученых, мог бы стать отечественный AI-лингвист. Он мог бы консультировать пользователей по вопросам казахского языка, помогать в подготовке филологов и лингвистов, а также подбирать индивидуальные программы изучения государственного языка для людей разного возраста. В дальнейшем на этой же языковой базе могут появиться специализированные модели - AI-врач, AI-инженер, AI-логопед, AI-провизор, AI-юрист и другие.
«Такие отраслевые модели могли бы помочь специалистам полноценно работать на государственном языке. Это одновременно повысит качество казахоязычной коммуникации и увеличит объем качественного контента. В эпоху искусственного интеллекта полноценное функционирование казахского языка в цифровом пространстве приобретает стратегическое значение для образования, науки, культуры, государственного управления и национальной безопасности», - сказала Анар Фазылжан.
Однако для развития таких технологий одного программного обеспечения недостаточно. Как отметила спикер, сегодня остается проблема нехватки большой и качественной эмпирической базы живого казахского языка. Для современных систем нужны значительные массивы художественной и научной литературы, официально-деловых документов, материалов СМИ, интернет-текстов, живой разговорной речи, диалектов и учебных материалов. Без них сложно развивать машинный перевод, автоматическую проверку текстов, распознавание устной и письменной речи, а также полноценные большие языковые модели.
Еще один вызов - подготовка нового поколения специалистов. Современному лингвисту, по словам Анар Фазылжан, уже недостаточно исключительно классического филологического образования. Необходимы знания в области NLP, корпусной и цифровой лингвистики, психолингвистики, нейролингвистики, обработки данных, основ программирования и академического письма.
Отдельным направлением работы Института станет развитие нейролингвистики и клинической лингвистики. Ученые планируют исследовать связь языка и работы человеческого мозга, развивать экспериментальную базу и сотрудничество с медицинскими и научными центрами. В дальнейшем результаты таких исследований могут применяться в нейрохирургии, неврологии, медицинской реабилитации и инклюзивном образовании.
В Институте уже появился айтрекер - видеоокулографический аппарат для психолингвистических исследований. Подобное оборудование, по данным спикера, сегодня имеется лишь в четырех научных центрах Казахстана. Также приобретены мобильная кабина для записи устной речи, цифровое аудиооборудование и сервер с тремя GPU для работы с масштабными языковыми ресурсами.
Конечной целью этой работы в Институте называют создание единой национальной лингвистической экосистемы, которая объединит Национальный корпус казахского языка, академические словари, терминологические базы и данные для обучения искусственного интеллекта. Это должно позволить казахскому языку полноценно функционировать не только в повседневной коммуникации, но и в науке, технологиях и системах искусственного интеллекта.
Читайте также: В Казахстане началась масштабная модернизация гидроинфраструктуры