Новости
Старший научный сотрудник ИЯЛИ КарНЦ РАН Александра Родионова и ректор Марийского государственного университета Михаил Швецов
28 апреля 2026
Лингвисты передали «Яндексу» более 50 тысяч предложений на карельском языке для подготовки онлайн-переводчика

Специалисты языковой платформы «ВепКар» продолжают работу по подготовке данных для создания онлайн-переводчиков карельского и вепсского языков на базе «Яндекса». Компании передано уже более половины из необходимых 100 тысяч предложений на ливвиковском наречии карельского языка – примеров текстов разных жанров. Об этом и других направлениях развития платформы рассказала старший научный сотрудник ИЯЛИ КарНЦ РАН Александра Родионова в ходе VII Международной конференции «Цифровизация языков народов России: Масштабирование опыта и перспективы» в Йошкар-Оле.
VII Международная научно-практическая конференция «Цифровизация языков народов России: Масштабирование опыта и перспективы» проходила в Марийском государственном университете 16–17 апреля. В ходе пленарного заседания выступила старший научный сотрудник Института языка, литературы и истории КарНЦ РАН Александра Родионова. Лингвист подвела итоги десятилетней работы открытого корпуса вепсского и карельского языков ВепКар и рассказала о новых направлениях и перспективах его развития.

ВепКар – это уникальная цифровая платформа, созданная языковедами и математиками Карельского научного центра РАН. Во-первых, это единственный в мире корпус вепсского и карельского языков. Корпус — это информационно-справочная система, основанная на собрании текстов различных жанров в электронной форме. ВепКар содержит более девяти тысяч текстов на 58 диалектах и почти три миллиона слов. Почти все они имеют разметку – лингвистическую или метатекстовую – что позволяет пользователям узнавать лексические, грамматические и другие характеристики элементов текста. Это бесценная информация для исследователей или изучающих язык. Во-вторых, за время своего развития ВепКар из коллекции текстов превратился во многофункциональную языковую платформу, на базе которой помимо основной библиотеки функционируют крупные ресурсы: Аудиокарта прибалтийско-финских языков Карелии, Мультимедийный словарь карельского языка LiPaS – Livvin paginan sanat и Людиковский диалектный лексикон.

Создатели и специалисты "ВепКара" (слева направо): Екатерина Захарова, Наталья Крижановская, Ирина Новак, Наталия Пеллинен, Александра Родионова, Анастасия Рунтова, Татьяна Бойко, Андрей Крижановский и Нина Шибанова
Создатели и специалисты ВепКара (слева направо): старший научный сотрудник сектора языкознания ИЯЛИ КарНЦ РАН Екатерина Захарова, ведущий инженер-исследователь лаборатории информационных компьютерных технологий ИПМИ КарНЦ РАН Наталья Крижановская, директор ИЯЛИ КарНЦ РАН Ирина Новак, научный сотрудник сектора языкознания ИЯЛИ КарНЦ РАН Наталия Пеллинен, старший научный сотрудник сектора языкознания ИЯЛИ КарНЦ РАН Александра Родионова, заведующая сектором Научной библиотеки Тверского государственного университета Анастасия Рунтова, научный сотрудник сектора языкознания ИЯЛИ КарНЦ РАН Татьяна Бойко, руководитель лаборатории информационных компьютерных технологий ИПМИ КарНЦ РАН Андрей Крижановский и главный специалист по информационным технологиям ИЯЛИ КарНЦ РАН Нина Шибанова

– У истоков проекта стоит доктор филологических наук Нина Григорьевна Зайцева. Именно под её руководством в 2009 году стартовала работа по созданию Корпуса вепсского языка — предшественника современного ВепКара. В 2016 году ресурс был существенно расширен: в его состав вошли тексты на карельском языке, – рассказала об истории создания платформы Александра Родионова. В этом году ВепКар отмечает свое десятилетие.

Параллельные, то есть с переводом на русский язык, тексты, которые накапливает ВепКар, работают одновременно на две задачи – развитие корпуса как исследовательского ресурса и создание технологической базы для присутствия карельского и вепсского языков во Всемирной сети. В частности, ВепКар является площадкой для подготовки данных для создания онлайн-переводчиков карельского и вепсского языков, которое ведется в рамках сотрудничества с Федеральным агентством по делам национальностей России, Министерством национальной и региональной политики Республики Карелия и компанией «Яндекс».

– Для обучения переводчика нужна база из ста тысяч предложений с переводом на русский язык. В ходе её формирования в корпусе реализована новая функция проверки выравнивания параллельных текстов на уровне предложений. На сегодняшний день в ВепКаре представлено свыше 1500 текстов на ливвиковском наречии карельского языка с переводом на русский. Суммарно программистам «Яндекса» передано уже более 50 тысяч предложений. Параллельно идёт подготовка аналогичной базы по вепсскому языку, – рассказала Александра Родионова.

Старший научный сотрудник ИЯЛИ КарНЦ РАН Александра Родионова на пленарном заседании конференции
Старший научный сотрудник ИЯЛИ КарНЦ РАН Александра Родионова на пленарном заседании конференции

Что касается подкорпусов ВепКара, то разработчики не только продолжают пополнять существующие, но и создают новые коллекции, повышая роль платформы как электронной библиотеки. Так, в рамках работы, приуроченной к 800-летию крещения карелов, был расширен подкорпус библейских текстов и открыты два новых: «Памятники письменности» и «Этнографические тексты». Последние позволяют проследить изменения в народных традициях и обрядах карелов, связанные с принятием христианства. На их основе стартовала разработка интерактивной карты «Праздничная культура Южной Карелии». Подкорпус «Памятники письменности» включает оцифрованные старописьменные и старопечатные тексты на карельском языке.

Также за последние годы серьезно расширились возможности ВепКара для лингвистических исследований. В первую очередь, это произошло в результате разработки программ-генераторов словоформ, созданных специалистами Института языка, литературы и истории и Института прикладных математических исследований КарНЦ РАН. Во-первых, она позволила довести долю автоматической разметки текстов в среднем по подкорпусам до 81,5%. Во-вторых, благодаря генераторам словоформ удалось выявить ряд лингвистических закономерностей, которые дополнили новые грамматики карельского и вепсского языков. Наконец, создание генераторов существенно ускорило работу редакторов и устранило ошибки ручного ввода.

Фрагмент главной страницы "ВепКара"
Фрагмент главной страницы "ВепКара"

– Это наглядный пример того, как инструментальная разработка стимулирует лингвистику. Морфологически размеченный корпус — необходимая база для создания морфологического анализатора, а в дальнейшем — систем проверки орфографии и машинного перевода с карельского и вепсского языков, – пояснила Александра Родионова.

Говоря перспективах развития, ученый рассказала о совершенствовании «предсказателя» — модуля, который подсказывает наиболее вероятный вариант привязки словоформы к словарному значению, создании эпистолярного подкорпуса, расширении возможностей для междисциплинарных исследований и разработке прикладных продуктов на базе корпусных данных: игр и учебных материалов.

– Опыт ВепКара показывает: корпус языка, находящегося под угрозой исчезновения, способен одновременно решать задачи сохранения языка, его научного изучения и цифрового развития. Для малых языков России это особенно важно — именно корпусная инфраструктура становится тем фундаментом, без которого невозможны ни полноценная лингвистика, ни современные языковые технологии, – подытожила ученый.

Фото: пресс-служба Марийского государственного университета

Смотрите также:

Лаборанты Центра Надежда Юнолайнен и Елена Курги
26 июня 2026
Специалисты Центра репродукции растений украсили цветами клумбы перед зданием КарНЦ РАН

Более 400 бархатцев украсили клумбы перед главным входом в здание Карельского научного центра РАН. Посадкой растений занимались специалисты КарНЦ РАН -- главный биолог Центра репродукции растений Александра Камова и лаборанты Центра Надежда Юнолайнен и Елена Курги
.
25 июня 2026
В КарНЦ РАН идет прием в аспирантуру на 2026/2027 учебный год

20 июня в Карельском научном центре РАН начался прием документов от поступающих в аспирантуру. Всего в этом году предусмотрено 8 мест приема на обучение по очной форме, 6 из них – за счет бюджета. Прием документов завершается 2 июля.
24 июня 2026
Ученые КарНЦ РАН предлагают восстанавливать карельские леса с использованием репродуктивного материала местного происхождения и селекции.

Ученые КарНЦ РАН приняли участие в совещании Главы Республики Карелия Артура Парфенчикова с представителями научного сообщества, депутатами Законодательного Собрания РК, а также руководителями ведомств, предприятий и организаций республики, занимающихся вопросами лесовосстановления.
Основные темы выступлений руководителя КарНЦ РАН Ольги Бахмет и директора Института леса КарНЦ РАН Бориса Раевского – результаты исследований ученых, анализ ситуации с лесовосстановлением в Карелии и рекомендации по увеличению объемов и темпов лесовосстановления за счет собственного производства семян и саженцев.
23 июня 2026
Карельский научный центр РАН примет участие в создании биоэкопоселений в Арктической зоне Карелии

Руководитель КарНЦ РАН Ольга Бахмет выступила на рабочем совещании, которое провел Глава Республики Карелия Артур Парфенчиков с руководством Национального исследовательского центра «Курчатовский институт», министрами, руководителями карельских предприятий и организаций. Основная тема выступления – разработка технологий для биоэкономики и их использование для биоэкопоселений.
Заместитель генерального директора КарНЦ РАН по научно-организационной работе Александр Слабунов
22 июня 2026
Работа над Положением о конкурсе продолжается

В Карельском научном центре РАН состоялось очередное заседание рабочей группы, которая занимается разработкой Положения о конкурсе на замещение должностей научных работников. В состав этой группы входят представители администрации центра, всех институтов и профсоюзов. Руководит ее работой заместитель генерального директора КарНЦ РАН по научно-организационной работе Александр Слабунов. Работа над этим Положением проводилась весь прошлый год, но завершить ее не удалось. В этом году есть надежда на то, что этот важнейший для КарНЦ РАН документ будет подготовлен, одобрен и подписан.