Новости
Старший научный сотрудник ИЯЛИ КарНЦ РАН Александра Родионова и ректор Марийского государственного университета Михаил Швецов
28 апреля 2026
Лингвисты передали «Яндексу» более 50 тысяч предложений на карельском языке для подготовки онлайн-переводчика

Специалисты языковой платформы «ВепКар» продолжают работу по подготовке данных для создания онлайн-переводчиков карельского и вепсского языков на базе «Яндекса». Компании передано уже более половины из необходимых 100 тысяч предложений на ливвиковском наречии карельского языка – примеров текстов разных жанров. Об этом и других направлениях развития платформы рассказала старший научный сотрудник ИЯЛИ КарНЦ РАН Александра Родионова в ходе VII Международной конференции «Цифровизация языков народов России: Масштабирование опыта и перспективы» в Йошкар-Оле.
VII Международная научно-практическая конференция «Цифровизация языков народов России: Масштабирование опыта и перспективы» проходила в Марийском государственном университете 16–17 апреля. В ходе пленарного заседания выступила старший научный сотрудник Института языка, литературы и истории КарНЦ РАН Александра Родионова. Лингвист подвела итоги десятилетней работы открытого корпуса вепсского и карельского языков «ВепКар» и рассказала о новых направлениях и перспективах его развития.

«ВепКар» – это уникальная цифровая платформа, созданная языковедами и математиками Карельского научного центра РАН. Во-первых, это единственный в мире корпус вепсского и карельского языков. Корпус — это информационно-справочная система, основанная на собрании текстов различных жанров в электронной форме. «ВепКар» содержит более девяти тысяч текстов на 58 диалектах и почти три миллиона слов. Почти все они имеют разметку – лингвистическую или метатекстовую – что позволяет пользователям узнавать лексические, грамматические и другие характеристики элементов текста. Это бесценная информация для исследователей или изучающих язык. Во-вторых, за время своего развития «ВепКар» из коллекции текстов превратился во многофункциональную языковую платформу, на базе которой помимо основной библиотеки функционируют крупные ресурсы: Аудиокарта прибалтийско-финских языков Карелии, Мультимедийный словарь карельского языка LiPaS – Livvin paginan sanat и Людиковский диалектный лексикон.

Создатели и специалисты "ВепКара" (слева направо): Екатерина Захарова, Наталья Крижановская, Ирина Новак, Наталия Пеллинен, Александра Родионова, Анастасия Рунтова, Татьяна Бойко, Андрей Крижановский и Нина Шибанова
Создатели и специалисты "ВепКара" (слева направо): старший научный сотрудник сектора языкознания ИЯЛИ КарНЦ РАН Екатерина Захарова, ведущий инженер-исследователь лаборатории информационных компьютерных технологий ИПМИ КарНЦ РАН Наталья Крижановская, директор ИЯЛИ КарНЦ РАН Ирина Новак, научный сотрудник сектора языкознания ИЯЛИ КарНЦ РАН Наталия Пеллинен, старший научный сотрудник сектора языкознания ИЯЛИ КарНЦ РАН Александра Родионова, заведующая сектором Научной библиотеки Тверского государственного университета Анастасия Рунтова, научный сотрудник сектора языкознания ИЯЛИ КарНЦ РАН Татьяна Бойко, руководитель лаборатории информационных компьютерных технологий ИПМИ КарНЦ РАН Андрей Крижановский и главный специалист по информационным технологиям ИЯЛИ КарНЦ РАН Нина Шибанова. Фото: И. Георгиевский / КарНЦ РАН

– У истоков проекта стоит доктор филологических наук Нина Григорьевна Зайцева. Именно под её руководством в 2009 году стартовала работа по созданию «Корпуса вепсского языка» — предшественника современного «ВепКара». В 2016 году ресурс был существенно расширен: в его состав вошли тексты на карельском языке, – рассказала об истории создания платформы Александра Родионова. В этом году «ВепКар» отмечает свое десятилетие.

Параллельные, то есть с переводом на русский язык, тексты, которые накапливает «ВепКар», работают одновременно на две задачи – развитие корпуса как исследовательского ресурса и создание технологической базы для присутствия карельского и вепсского языков во Всемирной сети. В частности, «ВепКар» является площадкой для подготовки данных для создания онлайн-переводчиков карельского и вепсского языков, которое ведется в рамках сотрудничества с Федеральным агентством по делам национальностей России и компанией «Яндекс».

– Для обучения переводчика нужна база из ста тысяч предложений с переводом на русский язык. В ходе её формирования в корпусе реализована новая функция проверки выравнивания параллельных текстов на уровне предложений. На сегодняшний день в «ВепКаре» представлено свыше 1500 текстов на ливвиковском наречии карельского языка с переводом на русский. Суммарно программистам «Яндекса» передано уже более 50 тысяч предложений. Параллельно идёт подготовка аналогичной базы по вепсскому языку, – рассказала Александра Родионова.

Старший научный сотрудник ИЯЛИ КарНЦ РАН Александра Родионова на пленарном заседании конференции
Старший научный сотрудник ИЯЛИ КарНЦ РАН Александра Родионова на пленарном заседании конференции

Что касается подкорпусов «ВепКара», то разработчики не только продолжают пополнять существующие, но и создают новые коллекции, повышая роль платформы как электронной библиотеки. Так, в рамках работы, приуроченной к 800-летию крещения карелов, был расширен подкорпус библейских текстов и открыты два новых: «Памятники письменности» и «Этнографические тексты». Последние позволяют проследить изменения в народных традициях и обрядах карелов, связанные с принятием христианства. На их основе стартовала разработка интерактивной карты «Праздничная культура Южной Карелии». Подкорпус «Памятники письменности» включает оцифрованные старописьменные и старопечатные тексты на карельском языке.

Также за последние годы серьезно расширились возможности «ВепКара» для лингвистических исследований. В первую очередь, это произошло в результате разработки программ-генераторов словоформ, созданных специалистами Института языка, литературы и истории и Института прикладных математических исследований КарНЦ РАН. Во-первых, она позволила довести долю автоматической разметки текстов в среднем по подкорпусам до 81,5%. Во-вторых, благодаря генераторам словоформ удалось выявить ряд лингвистических закономерностей, которые дополнили новые грамматики карельского и вепсского языков. Наконец, создание генераторов существенно ускорило работу редакторов и устранило ошибки ручного ввода.

Фрагмент главной страницы "ВепКара"
Фрагмент главной страницы "ВепКара"

– Это наглядный пример того, как инструментальная разработка стимулирует лингвистику. Морфологически размеченный корпус — необходимая база для создания морфологического анализатора, а в дальнейшем — систем проверки орфографии и машинного перевода с карельского и вепсского языков, – пояснила Александра Родионова.

Говоря перспективах развития, ученый рассказала о совершенствовании «предсказателя» — модуля, который подсказывает наиболее вероятный вариант привязки словоформы к словарному значению, создании эпистолярного подкорпуса, расширении возможностей для междисциплинарных исследований и разработке прикладных продуктов на базе корпусных данных: игр и учебных материалов.

– Опыт «ВепКара» показывает: корпус языка, находящегося под угрозой исчезновения, способен одновременно решать задачи сохранения языка, его научного изучения и цифрового развития. Для малых языков России это особенно важно — именно корпусная инфраструктура становится тем фундаментом, без которого невозможны ни полноценная лингвистика, ни современные языковые технологии, – подытожила ученый.

Фото: пресс-служба Марийского государственного университета

Смотрите также:

Церемония «Книга года Республики Карелия – 2025»
26 апреля 2026
Три издания КарНЦ РАН стали лауреатами конкурса «Книга года Республики Карелия – 2025»

На церемонии награждения победителей XXVI республиканского конкурса «Книга года Республики Карелия – 2025» были отмечены все три издания КарНЦ РАН: «Ливвиковские деревни от A до Ä: словарь названий населённых мест», «Куркиёки: археология, история, культура» и «Познавательные путешествия карельских зверят».
Ольга Бахмет и Александр Сафронов: подписание соглашения
25 апреля 2026
КарНЦ РАН и «ПКС-Водоканал» заключили соглашение о сотрудничестве в области создания и использования почвогрунтов

Руководители Карельского научного центра РАН Ольга Бахмет и АО «Петрозаводские коммунальные системы – Водоканал» Александр Сафронов заключили соглашение о сотрудничестве. Оно предусматривает взаимодействие в сфере научно-исследовательской деятельности, связанной с изучением свойств и возможных областей применения искусственных почвогрунтов.
Конференция трудового коллектива
23 апреля 2026
В КарНЦ РАН состоялась Конференция трудового коллектива

В Карельском научном центре Российской академии наук состоялась Конференция трудового коллектива, на которой рассматривался ход выполнения Коллективного договора между работодателем и работниками КарНЦ РАН в 2025 год. Были заслушаны два доклада, делегаты живо и критично их обсудили и высказали предложения по улучшению взаимодействия сторон договора.
Восстановление популяции лосося и жемчужницы в заповеднике "Кивач"
23 апреля 2026
Ученые КарНЦ РАН принимают участие в проекте заповедника «Кивач» по восстановлению популяции лосося и жемчужницы на участке реки Суна

Специалисты Института биологии КарНЦ РАН принимают участие в проекте по восстановлению популяции атлантического лосося и пресноводной жемчужницы на участке реки Суна в пределах заповедника «Кивач».
Руководитель КарНЦ РАН Ольга Бахмет и президент Академии наук Абхазии Зураб Джапуа
22 апреля 2026
Руководители КарНЦ РАН и Академии наук Абхазии подписали соглашение о сотрудничестве

Руководитель КарНЦ РАН Ольга Бахмет и президент Академии наук Абхазии Зураб Джапуа подписали соглашение о сотрудничестве. Подписание состоялось во время открытия XII Международного научно-практического семинара «Методика полевых работ, архивация и изучение фольклорных, этнографических, лингвистических и рукописных материалов», посвященного 100-летию комплексных экспедиций в Заонежье, 70-летию фонограммархива ИЯЛИ КарНЦ РАН и 60-летию музея-заповедника Кижи.