Поиск Яндекса

Корпус русского языка расширили текстами из социальных сетей

Национальный корпус русского языка вырос более чем в шесть раз: в него добавили 11,3 млрд словоупотреблений из соцсетей. Это поможет изучать живой русский язык в цифровой среде

Что случилось

Национальный корпус русского языка (НКРЯ) получил самое крупное обновление за всю историю проекта. В него добавили Генеральный интернет-корпус русского языка — большой массив текстов из социальных сетей. После этого общий объем НКРЯ вырос более чем в шесть раз: с 2,2 млрд до 13,5 млрд словоупотреблений.

НКРЯ — это поисковая база текстов, которую используют лингвисты, филологи, преподаватели, разработчики языковых технологий и все, кто изучает русский язык. С помощью корпуса можно искать слова и выражения в реальных текстах, сравнивать употребление в разные периоды и анализировать, как меняются грамматика, лексика и стиль речи.

Новая часть корпуса включает 11,3 млрд словоупотреблений из текстов пользователей «ВКонтакте». В нее вошли публикации, написанные с 2007 года до начала 2022 года. Для лингвистов это особенно ценный материал: соцсети показывают, как люди пишут в повседневной жизни, вне книг, СМИ, официальных документов и отредактированных текстов.

Такая речь часто ближе к устной, так как пользователи пишут быстро, сокращают слова, смешивают стили, используют разговорные выражения, мемы, сленг, локальные слова и новые устойчивые фразы. Именно такие языковые явления обычно трудно изучать по традиционным источникам, потому что они редко попадают в литературные тексты или прессу.

Обновление позволит исследователям точнее отслеживать, как меняется современный русский язык. По данным корпуса можно будет смотреть, когда появляются новые слова и выражения, как быстро они распространяются, в какие годы становятся особенно заметными и в каких контекстах используются. Например, корпусные данные помогают понять, какие слова закрепляются в массовой речи, а какие остаются временной интернет-модой.

Популярность слова «годнота»

Контекст и предпосылки

Владимир Александрович Плунгян, академик РАН, научный руководитель НКРЯ, заместитель директора по научной работе Института русского языка им. В. В. Виноградова РАН:

«Объем добавленной коллекции текстов составляет более 11 млрд словоупотреблений, что делает ее крупнейшим корпусом на платформе НКРЯ (и одним из крупнейших корпусов в мире). Главное значение этого обновления в том, что оно соединяет два дополняющих друг друга подхода к изучению языка.

Национальный корпус традиционно строится как репрезентативная коллекция: он показывает русский язык разных жанров, стилей и исторических периодов — от литературы и публицистики до устной речи и форумов. Генеральный интернет-корпус устроен иначе: он концентрируется на большом массиве относительно однородных интернет-текстов, но снабжает их данными о времени публикации, месте проживания и поле автора. Благодаря этому исследователь получает возможность не просто найти примеры употреблений слов или выражений, а увидеть, как они распределены по регионам, возрастным группам, периодам времени, гендерной принадлежности автора. Это особенно важно для русского языка XXI века.

Социальные сети фиксируют устно-письменную речь, где быстрее всего проявляются новые заимствования, неологизмы, разговорные конструкции, регионализмы и новые словообразовательные модели. Датировка публикаций с точностью до месяца позволяет наблюдать языковые изменения почти в реальном времени, проследить, когда новое слово появляется, как распространяется, где закрепляется и когда уходит из активного употребления».

Вероятные последствия

Большие массивы реальных текстов помогают лучше понимать, как люди формулируют мысли в интернете, какие ошибки делают и какие нестандартные выражения используют. Это может быть полезно для поисковых систем, голосовых ассистентов, автокорректоров, переводчиков, языковых моделей и других инструментов, работающих с русским языком. Чем разнообразнее данные о языке, тем точнее такие системы могут распознавать смысл фраз и учитывать контекст. Особенно это важно для неформальной речи, которую сложнее обрабатывать по правилам литературного языка. Соцсети фиксируют не только язык, но и следы общественных настроений, повседневных привычек и популярных тем разных лет. По таким данным можно будет смотреть, как распространялись мемы, какие слова становились маркерами времени и как менялась манера общения пользователей. Это делает корпус полезным для лингвистов, социологов, культурологов и исследователей цифровой среды.

➤ Подписывайтесь на телеграм-канал «РБК Трендов» — будьте в курсе последних тенденций в науке, бизнесе, обществе и технологиях.