Полный сегмент ВКонтакте на платформе НКРЯ

На платформе НКРЯ полностью опубликован сегмент ГИКРЯ 2.0 ВКонтакте. В него вошло 900 559 566 текстов общим объемом 15 561 755 506 слов.

Метатекстовая разметка включает год и месяц написания текста и его тип (пост или комментарий), год рождения, возраст (на момент написания текста) пол и регион автора, извлеченные из его профиля в социальной сети. Доступна общая статистика корпуса по этим атрибутам.

По этим же параметрам доступно задание подкорпуса, в котором осуществляется поиск. Поиск поддерживается по словоформе и лемме (есть специальный режим их задания в виде регулярных выражений), грамматическим атрибутам, дополнительным признакам (в начале/конце предложения, до/после знаков препинания, …). На странице результатов поиска можно перейти в режимы Графики и Статистика для анализа распределения результатов.

Для зарегистрированных пользователей НКРЯ доступно скачивание результатов поиска в Excel в объеме до 50 000 сниппетов.

Дорогие коллеги и пользователи корпуса! Нам очень важна обратная связь от вас: пишите нам по адресу info@ruscorpora.ru. Если вы обнаружили ошибку в системе НКРЯ, можно также сообщить об этом через форму.

 

 

ГИКРЯ 2.0 на платформе НКРЯ

Дорогие коллеги и пользователи корпуса!

Бета-версия ГИКРЯ 2.0 доступна на платформе НКРЯ! В нее вошли тексты социальной сети «ВКонтакте» с 2007 по начало 2022 г. общим объемом 11,3 млрд слов.

Морфологическая разметка ГИКРЯ 2.0 выполнена с помощью интегрального морфосинтаксического парсера (автор — Даниил Анастасьев) с доработанной лемматизацией (подробнее о наших доработках можно почитать здесь). Полученная разметка в формате Universal Dependencies затем преобразована в морфологический стандарт НКРЯ.

Метатекстовая разметка включает год и месяц написания текста и его тип (пост или комментарий), год рождения, пол и регион автора, извлеченные из его профиля в социальной сети.

Интерфейс НКРЯ позволяет выполнять поиск по лемме, словоформе, и грамматическим признакам (в т.ч. с использованием регулярных выражений), задавать подкорпус по метатекстовым признакам, получать выдачу в форматах Конкорданс и KWIC с сортировкой по заданному параметру, строить графики по времени публикации текста и получать статистику по социолингвистическим параметрам.

Будем рады ответить на ваши вопросы по ГИКРЯ 2.0: пишите нам по адресу info@ruscorpora.ru. Если вы обнаружили ошибку в системе НКРЯ, сообщите об этом через форму.