Что случилось
Национальный корпус русского языка (НКРЯ) получил самое крупное обновление за всю историю проекта. В него добавили Генеральный интернет-корпус русского языка — большой массив текстов из социальных сетей. После этого общий объем НКРЯ вырос более чем в шесть раз: с 2,2 млрд до 13,5 млрд словоупотреблений.
НКРЯ — это поисковая база текстов, которую используют лингвисты, филологи, преподаватели, разработчики языковых технологий и все, кто изучает русский язык. С помощью корпуса можно искать слова и выражения в реальных текстах, сравнивать употребление в разные периоды и анализировать, как меняются грамматика, лексика и стиль речи.
Новая часть корпуса включает 11,3 млрд словоупотреблений из текстов пользователей «ВКонтакте». В нее вошли публикации, написанные с 2007 года до начала 2022 года. Для лингвистов это особенно ценный материал: соцсети показывают, как люди пишут в повседневной жизни, вне книг, СМИ, официальных документов и отредактированных текстов.
Такая речь часто ближе к устной, так как пользователи пишут быстро, сокращают слова, смешивают стили, используют разговорные выражения, мемы, сленг, локальные слова и новые устойчивые фразы. Именно такие языковые явления обычно трудно изучать по традиционным источникам, потому что они редко попадают в литературные тексты или прессу.
Обновление позволит исследователям точнее отслеживать, как меняется современный русский язык. По данным корпуса можно будет смотреть, когда появляются новые слова и выражения, как быстро они распространяются, в какие годы становятся особенно заметными и в каких контекстах используются. Например, корпусные данные помогают понять, какие слова закрепляются в массовой речи, а какие остаются временной интернет-модой.
Популярность слова «годнота»
Контекст и предпосылки
Владимир Александрович Плунгян, академик РАН, научный руководитель НКРЯ, заместитель директора по научной работе Института русского языка им. В. В. Виноградова РАН:
«Объем добавленной коллекции текстов составляет более 11 млрд словоупотреблений, что делает ее крупнейшим корпусом на платформе НКРЯ (и одним из крупнейших корпусов в мире). Главное значение этого обновления в том, что оно соединяет два дополняющих друг друга подхода к изучению языка.
Национальный корпус традиционно строится как репрезентативная коллекция: он показывает русский язык разных жанров, стилей и исторических периодов — от литературы и публицистики до устной речи и форумов. Генеральный интернет-корпус устроен иначе: он концентрируется на большом массиве относительно однородных интернет-текстов, но снабжает их данными о времени публикации, месте проживания и поле автора. Благодаря этому исследователь получает возможность не просто найти примеры употреблений слов или выражений, а увидеть, как они распределены по регионам, возрастным группам, периодам времени, гендерной принадлежности автора. Это особенно важно для русского языка XXI века.
Социальные сети фиксируют устно-письменную речь, где быстрее всего проявляются новые заимствования, неологизмы, разговорные конструкции, регионализмы и новые словообразовательные модели. Датировка публикаций с точностью до месяца позволяет наблюдать языковые изменения почти в реальном времени, проследить, когда новое слово появляется, как распространяется, где закрепляется и когда уходит из активного употребления».
Вероятные последствия
Большие массивы реальных текстов помогают лучше понимать, как люди формулируют мысли в интернете, какие ошибки делают и какие нестандартные выражения используют. Это может быть полезно для поисковых систем, голосовых ассистентов, автокорректоров, переводчиков, языковых моделей и других инструментов, работающих с русским языком. Чем разнообразнее данные о языке, тем точнее такие системы могут распознавать смысл фраз и учитывать контекст. Особенно это важно для неформальной речи, которую сложнее обрабатывать по правилам литературного языка. Соцсети фиксируют не только язык, но и следы общественных настроений, повседневных привычек и популярных тем разных лет. По таким данным можно будет смотреть, как распространялись мемы, какие слова становились маркерами времени и как менялась манера общения пользователей. Это делает корпус полезным для лингвистов, социологов, культурологов и исследователей цифровой среды.
➤ Подписывайтесь на телеграм-канал «РБК Трендов» — будьте в курсе последних тенденций в науке, бизнесе, обществе и технологиях.