# Парсинг отзывов покупателей: сбор и анализ тональности | Блог

# Парсинг отзывов покупателей: как собрать и проанализировать мнения о товаре

          Инструменты
             10 июля 2026
             4 мин чтения

                    
            Оглавление
            
1. [Зачем анализировать отзывы конкурентов, а не только своих](#sec-1)
2. [Что извлекается из отзыва](#sec-2)
3. [Тональность отзыва: как она оценивается](#sec-3)
4. [Практическое применение для e-commerce](#sec-4)
5. [Предобработка текста: почему это важнее самой модели](#sec-5)
6. [Словарные и нейросетевые подходы: в чём разница на практике](#sec-6)
7. [Как оценить, работает ли модель тональности корректно](#sec-7)

          
                    Отзывы покупателей — один из самых информативных, но и самых трудозатратных для ручного анализа источников данных о товаре. Когда у карточки на маркетплейсе тысячи отзывов, прочитать их все физически невозможно — а парсинг с последующим анализом тональности превращает этот массив текста в конкретные цифры и категории.

## Зачем анализировать отзывы конкурентов, а не только своих

Отзывы на карточки конкурентов показывают, чем реально недовольны или довольны покупатели похожего товара — это готовый список сильных и слабых сторон, которые можно учесть при позиционировании собственного продукта или доработке его характеристик. Собственные отзывы, в свою очередь, полезно анализировать в динамике: не разово, а с отслеживанием, как меняется тональность после смены поставщика, упаковки или описания карточки.

## Что извлекается из отзыва

Помимо самого текста, из карточки отзыва собираются рейтинг (оценка в звёздах), дата публикации, иногда — вариант товара, к которому относится отзыв (например, конкретный цвет или размер), и информация о том, подтверждена ли покупка. Эти поля позволяют не просто прочитать текст, а построить таблицу: например, средний рейтинг по месяцам или доля отзывов с фото.

## Тональность отзыва: как она оценивается

Тональность — это классификация текста как позитивного, негативного или нейтрального. Базовый подход строится на словарях эмоционально окрашенной лексики и оценке в звёздах как дополнительном сигнале; более точный — на моделях, обученных на большом объёме размеченных отзывов, которые учитывают контекст («неплохой» и «не очень» — разная тональность при похожих словах). На выходе получается не просто список текстов, а сводная статистика: какая доля отзывов негативная и какие темы в них чаще всего повторяются.

## Практическое применение для e-commerce

- Выявление повторяющихся жалоб на конкретный дефект или недостаток товара для передачи поставщику;
- Сравнение среднего рейтинга и тональности своей карточки с карточками прямых конкурентов;
- Отслеживание, как тональность меняется после смены партии товара или упаковки;
- Приоритизация тем для ответа службы поддержки — сначала на самые частые негативные упоминания.

Как и в остальных случаях, мы собираем только те отзывы, которые видны любому посетителю страницы товара, без обхода авторизации личного кабинета покупателя.

## Предобработка текста: почему это важнее самой модели

Перед тем как передать массив отзывов на анализ тональности, сырой текст проходит через несколько обязательных этапов очистки. По данным рынка, стандартная предобработка включает **токенизацию** (разбивку на отдельные слова и знаки препинания), **удаление стоп-слов** (союзов, предлогов, частиц, не несущих эмоциональной окраски) и **нормализацию словоформ** (приведение слов к начальной форме, чтобы «плохой» и «плохого» учитывались как одна единица). Только после этой подготовки текст поступает в модель, иначе шум от неинформативных элементов может исказить итоговую статистику.

Особенно критична нормализация для русского языка с его развитой системой окончаний: без неё одно и то же слово в разных падежах будет считаться разными сущностями, что размывает картину тональности. Если вы сомневаетесь, корректно ли настроен пайплайн обработки данных в вашем проекте, мы подготовили [чек-лист проверки качества данных парсинга](/blog/kak-proverit-kachestvo-dannyh-parsinga), где пошагово разобраны критерии чистоты текстового массива.

## Словарные и нейросетевые подходы: в чём разница на практике

При определении тональности отзывов на рынке используются два принципиально разных класса решений — и выбор между ними напрямую влияет на точность и скорость анализа.

- **Словарные (лексические) методы.** Работают на основе заранее заданных списков слов с закреплёнными весами — например, слово «отличный» получает положительный вес, а «ужасный» — отрицательный. Плюс таких моделей в скорости и лёгкости развёртывания, но они не улавливают иронию и контекст: фразу «очень даже ничего» они могут классифицировать как нейтральную, хотя на самом деле это сдержанное одобрение.
- **Нейросетевые модели (BERT, RoBERTa, GPT).** Учитывают весь контекст предложения, а не отдельные слова. Благодаря обучению на больших размеченных корпусах отзывов такие модели способны распознать, что «неплохой» — это позитив, а «не очень» — скорее негатив, хотя лексически оба выражения содержат похожие по частотности слова. Главный недостаток — более высокие требования к вычислительным ресурсам и время на обучение/развёртывание.

При постоянном мониторинге отзывов на маркетплейсах (в том числе в рамках тарифа парсинга маркетплейсов от 4000 руб/мес) практический смысл имеет именно комбинация обоих подходов: словарная фильтрация как быстрый первый проход по всему массиву, а нейросетевая модель — точечно, для спорных текстов, где тональность неочевидна. Такое сочетание помогает удержать баланс между скоростью обработки тысяч отзывов и точностью детекции скрытых эмоций.

## Как оценить, работает ли модель тональности корректно

Даже самая качественная нейросеть может ошибаться на специфическом сленге маркетплейсов или на коротких эмоциональных сообщениях вроде «фу» или «топ». Проверка качества разметки тональности должна быть регулярной — для этого на рынке применяют ручную валидацию случайной выборки отзывов (обычно 5–10% массива) и сравнение с автоматической классификацией. Если расхождение превышает 10–15% по доле негативных оценок, требуется дообучение модели или корректировка словаря стоп-слов. Именно на этапе валидации особенно важен чистый исходный текст: малейшая ошибка в предобработке, например, сохранение эмодзи как знаков препинания, может сместить тональность целой категории отзывов в нейтральную зону.

                    ## Частые вопросы

                        Собираете ли вы отзывы с фото и видео от покупателей?
                +

              Да, если такие отзывы отображаются на странице товара как общедоступный контент — вместе с текстом можно собрать признак наличия фото/видео и, при необходимости, сами файлы.

                        Можно ли отслеживать, как меняется тональность отзывов после смены поставщика или упаковки?
                +

              Да, при регулярном (не разовом) сборе тональность и рейтинг отслеживаются в динамике — так видно, повлияло ли конкретное изменение на восприятие товара покупателями.

                        Насколько точно определяется тональность отзыва автоматически?
                +

              Базовый подход на словарях эмоциональной лексики даёт приемлемую точность для сортировки по темам, но не улавливает тонкие оттенки контекста. Модели, обученные на размеченных отзывах, точнее различают похожие по словам, но разные по смыслу формулировки — какой подход нужен, зависит от требуемой точности анализа.

                        Можно ли собирать отзывы только с определённым рейтингом, например только негативные?
                +

              Да, после сбора отзывы можно отфильтровать по рейтингу — например, оставить только оценки 1-2 звезды для приоритетного разбора жалоб службой поддержки.

                        Не нашли ответ на свой вопрос? [Задайте вопрос](#) — ответим напрямую.

        
                    ### Другие статьи

                        [**Парсинг тарифов облачных сервисов для бизнеса: рынок после ухода AWS и Azure**
              Инструменты](/blog/parsing-tarifov-oblachnyh-servisov-dlya-biznesa)
                        [**Данные о ставках контекстной и таргетированной рекламы: как меняются CPC и CPM**
              Инструменты](/blog/dannye-o-stavkah-kontekstnoj-i-targetirovannoj-reklamy)
                        [**Мониторинг цен на хостинг и домены: почему цена продления часто выше цены покупки**
              Инструменты](/blog/monitoring-cen-na-hosting-i-domeny)
                        [**Парсинг сельскохозяйственных товарных цен: как устроен рынок данных по зерну**
              Инструменты](/blog/parsing-selskohozyaystvennyh-tovarnyh-cen-zerno)

                              ### Полезно по теме

                        [**Парсинг маркетплейсов**Услуга](/uslugi/parsing-marketpleysov/)
                        [**Парсинг товаров**Услуга](/uslugi/parsing-tovarov/)

            ## Похожие услуги

        [### Парсинг маркетплейсов

            Парсинг маркетплейсов — это сбор данных о товарах, продавцах и категориях с Wildberries, Ozon, Яндекс.Маркета и других площадок: названия, описания, характеристики, фото, цены, остатки, рейтинг и количество отзывов. В отличие от мониторинга цен, здесь задача шире — получить полный слепок карточки товара или всего ассортимента продавца/категории, а не только текущую стоимость. Это востребовано у поставщиков, аналитиков маркетплейсов, агентств и разработчиков собственных агрегаторов.

            
              Смотреть услугу](/uslugi/parsing-marketpleysov/)
                    [### Парсинг товаров

            Парсинг товаров — это автоматизированный сбор карточек: названий, описаний, характеристик, цен, изображений и остатков — с сайтов поставщиков, конкурентов или маркетплейсов. Сервис избавляет от ручного переноса информации в каталог и снижает количество ошибок при заполнении сотен и тысяч позиций.

            
              Смотреть услугу](/uslugi/parsing-tovarov/)

      
      ### Нужен похожий сбор данных для вашего проекта?

          Оставьте заявку — обсудим объём данных, частоту сбора и формат выдачи.
