К содержанию
Работа

Система анализа тональности и распространения смыслов в Twitter

Программный комплекс для исследования общественного мнения в Twitter. Аналитик задаёт событие или тему — например, выход нового iPhone, — а система непрерывно собирает связанные твиты, определяет их эмоциональную окраску, привязывает к географии и показывает, как отдельная мысль расходилась во времени. Главное отличие от счётчиков упоминаний: она ловит пересказ смысла своими словами, а не только формальный ретвит.

Главный экран проекта Нажмите, чтобы рассмотреть

Интерфейс воссоздан по описанию; исходные экраны не публикуются.

Система анализа тональности и распространения смыслов в Twitter 01 / 03
Система анализа тональности и распространения смыслов в Twitter — Главный экран проекта
Клиент
Медиакомпания
Индустрия
Медиа и новости
Срок
6 месяцев
Команда
4 человека

Задача

Подсчёт упоминаний и ретвитов отвечает на вопрос «сколько», но не отвечает на вопрос «откуда». Мнение редко распространяется дословно: человек прочитал чужую формулировку, согласился и написал её по-своему. Формальной связи между двумя публикациями при этом не остаётся — ни ретвита, ни ответа, ни ссылки. Для аналитика это означает, что цепочка обрывается там, где начинается самое интересное: настоящий источник формулировки теряется, а самым влиятельным автором выглядит тот, у кого больше подписчиков.

Нужно было восстановить эту цепочку: найти ранние источники смыслов, оценить охват, увидеть, в каком ключе тема обсуждалась в разных регионах, и отличить всплеск в одной географии от общего фона.

Решение

Тема наблюдения. Аналитик создаёт наблюдение: ключевые слова и выражения, временной интервал и, если нужно, географию. Дальше сбор идёт непрерывно — сервис получает твиты через API Twitter и сохраняет текст, автора, время публикации, координаты, связи ответов и ретвитов.

Подготовка текста. Каждая публикация проходит нормализацию: определение языка, очистку служебных элементов, токенизацию, удаление стоп-слов и приведение слов к базовой форме. На этом же шаге отсеиваются дубли, спам и нерелевантные сообщения — иначе они позже склеятся в ложные кластеры и завысят охват.

Тональность. Модуль сентимент-анализа относит сообщение к позитивным, негативным или нейтральным и рассчитывает выраженность оценки — то есть насколько сильно высказана позиция, а не только её знак.

Семантика. Второй модуль строит признаки текста по словам и устойчивым сочетаниям, сравнивает публикации по смысловой близости и объединяет их в тематические кластеры. Так внутри одной темы наблюдения проявляются отдельные смысловые линии: люди обсуждают одно событие, но говорят о разном.

Репост смысла. Ключевой механизм: система сопоставляет похожие по смыслу публикации с учётом времени их появления. Из этих пар и строится граф распространения идеи — от ранней формулировки к последующим сообщениям, которые передают ту же мысль другими словами. Порядок во времени здесь принципиален: он отделяет источник от последователей и позволяет показать не только самого популярного автора, но и более раннюю публикацию, от которой формулировка пошла в оборот.

География. Геоаналитика связывает твиты и ретвиты с координатами или указанной пользователем локацией. На карте видны начальные точки, дальнейшее распространение, локальные всплески и охват — и, поскольку тональность считается отдельно, видно и то, как менялась окраска темы по мере ухода из региона-источника.

Выдача результатов. Всё отдаётся через API и аналитический интерфейс: временная шкала, карта, цепочки распространения, ключевые авторы, тематические кластеры и распределение тональности. API-контур позволял забирать данные наблюдения во внешние отчёты и системы заказчика.

Реализация. Серверная часть написана на C#: парсеры Twitter и постоянный сбор, модули нормализации, тональности и семантического сравнения, геопривязка и API поверх результатов наблюдения.

Результат

Для выбранного события система строит аналитическую карту общественного мнения: динамику обсуждения во времени, географию источников и охвата, ключевые смысловые линии и соотношение позитивных, негативных и нейтральных сообщений.

Аналитик получает возможность, которой нет у обычной статистики упоминаний: проследить путь идеи от первой заметной публикации до самостоятельных пересказов и понять, где и в каком контексте она получила развитие. В одной модели соединяются четыре измерения — время, география, смысловая близость и эмоциональная окраска, — поэтому вопросы «кто сказал первым», «через кого это пошло» и «где это восприняли иначе» решаются на одних и тех же данных.

8 шагов конвейера: от постановки темы наблюдения до карты и графа распространения
4 измерения в одной модели: время, география, семантика и тональность
6 месяцев длительность проекта
4 человека команда
Ещё

Похожие проекты

Всё портфолио
Агентная ИИ-платформа полного цикла PR
Кейс PRTech-компания

Агентная ИИ-платформа полного цикла PR

Компания хочет упоминаний в прессе, но не хочет содержать PR-отдел. Платформа круглосуточно следит за инфополем, находит момент, когда компании есть что сказать, подбирает журналистов по их личной специализации, пишет каждому персональное письмо и доводит переписку до ответа. Пользователь при этом просто разговаривает с агентом в чате — а под разговором работают скоринг новостей, граф журналистов, генерация питчей и почтовая доставка.

ИИ-сотрудникиБаза знаний с умным поиском
GoReactTypeScriptPostgreSQL
Актуальная Россия 2.0 — мобильный гид по выставке современного искусства
Работа Клиент под NDA

Актуальная Россия 2.0 — мобильный гид по выставке современного искусства

Мобильный гид ежегодной выставки современного российского искусства. В телефоне помещается вся структура проекта: новости, сведения о выставке, программа, карта залов, каталог работ и профили художников. Приложение работает и как навигатор в зале, и как самостоятельный цифровой каталог, который остаётся у человека после визита.

Кастомная система
CopyCatch — платформа автоматической регистрации авторских прав
Работа CopyCatch

CopyCatch — платформа автоматической регистрации авторских прав

CopyCatch проводил автора через полную регистрацию авторского права в США — от создания аккаунта до официального сертификата U.S. Copyright Office. Публичный сайт объяснял услугу, но продуктом был защищённый кабинет: мастер заявления, библиотека дел, платежи, подача и отслеживание статуса. Главное в нём — заявка уходила в государственное ведомство автоматически, без повторного ручного ввода сотрудником сервиса.

Системы документооборотаКорпоративные порталы
PHPMySQL
Первый разговор — бесплатно

Расскажите, что хотите изменить

За одну встречу уточним задачу и предложим следующий шаг, даже если вам нужен другой подрядчик.

Что будет на встрече
  1. 01 Опишите задачу своими словами
  2. 02 Уточним цель и ограничения
  3. 03 Предложим решение и следующий шаг
длительность 45–60 мин