В каталоге две карточки почти одинаковые. Один и тот же бренд, похожее название, одинаковое фото. Можно склеить? А потом выясняется: одна — размер M, вторая — L.
Дубли товаров в каталоге нельзя искать только по похожести текста. Сначала нужно понять identity товара и отдельно — признаки варианта.
На большом каталоге я бы не пыталась автоматически `удалять дубли`. Система собирает candidate groups, показывает основания совпадения и различия, а подтверждённое решение становится правилом для следующих партий.
Сильные идентификаторы проверяйте раньше похожего названия
GTIN, внутренний SKU, артикул производителя и стабильные supplier IDs дают намного больше, чем текстовая похожесть. Если два источника указывают один корректный GTIN, это сильный candidate на один trade item.
Но идентификаторы тоже бывают грязными. Поэтому я бы сохраняла source и отдельно проверяла конфликты: один GTIN не должен неожиданно описывать два разных товара.
GS1 определяет GTIN как глобальный идентификатор trade item. Для dedup это хороший якорь, когда данные действительно корректны.
Проверяемые источники: GS1 — Ready to sell? Start with a GS1 barcode/GTIN
Variant-defining attributes нельзя потерять при merge
Размер, цвет, объём, комплектация или другая характеристика может делать SKU отдельным вариантом. Если dedup их игнорирует, каталог становится меньше ценой неправильных карточек.
Я бы сначала группировала product family, затем сравнивала variant-defining fields внутри группы. Parent может быть один, sellable SKU — разные.
Google Product Variant structured data тоже моделирует группу вариантов отдельно от конкретных offers. Это полезная логика для внутреннего каталога.
Проверяемые источники: Google Search Central — Product Variant Structured Data

Text similarity — только один сигнал
Названия от разных поставщиков могут отличаться сильно: сокращения, порядок слов, локальные обозначения. AI или embeddings хорошо собирают похожие candidates.
Но я бы не делала similarity финальным решением. После неё проверяются бренд, модель, ключевые атрибуты, GTIN и признаки варианта.
Так мы используем AI там, где он силён — быстро найти возможные совпадения — и не просим его самостоятельно менять product identity.
Проверяемые источники: GS1 — Allegro: Enhancing online shopping with trusted data
Candidate group должен показывать различия сразу
Редактору не нужны две длинные карточки рядом. Я бы показывала таблицу отличий: ID источников, бренд, GTIN, модель, variant fields и конфликтующие характеристики.
Если сильные поля совпали, решение можно подтвердить группой. Если есть один спорный размер или комплектация, этот SKU остаётся отдельно.
После подтверждения сохраняем merge decision и mapping source records к canonical product.
Проверяемые источники: GS1 — Ready to sell? Start with a GS1 barcode/GTIN · GS1 — Allegro: Enhancing online shopping with trusted data
Merge не должен ломать URL и канал публикации
Дубли уже могут иметь трафик, отзывы, marketplace IDs или активные offers. Просто удалить одну карточку после dedup — слишком грубо.
Я бы отделяла решение об identity от publication migration. Канонический товар определяется сначала, затем отдельно переносим связи, redirects и channel mappings.
Google отдельно рекомендует продуманную URL-структуру ecommerce-сайта. Dedup не должен создавать хаос в уже индексируемых URL.
Проверяемые источники: Google Search Central — Designing a URL structure for ecommerce sites
Метрика — меньше дублей без роста ошибочных склеек
Снизить число карточек легко: склеить всё похожее. Это не цель.
Я бы считала confirmed duplicate groups, false merge corrections и долю candidate groups, которые редактор принимает с первого прохода. Отдельно — источники, которые чаще создают повторные товары.
Нормальный dedup-поток сокращает шум и сохраняет реальные variants. Если после него редакторы вручную восстанавливают размеры и цвета, автоматизация работает против каталога.
Проверяемые источники: Google Search Central — Product Variant Structured Data · GS1 — Ready to sell? Start with a GS1 barcode/GTIN
Источник дубля полезно исправлять, а не только чистить master
Если один поставщик каждую неделю создаёт новые copies одного товара, dedup будет бесконечно убирать последствия. Я бы считала duplicate rate по source.
Повторяющийся паттерн можно превратить в upstream rule: нормализовать supplier ID, исправить mapping или отклонять новую запись ещё до master catalog.
Тогда очередь кандидатов действительно уменьшается. Иначе мы построили красивую уборочную машину вокруг постоянной утечки данных.
Полезно разделять exact duplicate и probable duplicate. Первый может проходить автоматически после сильных identifiers. Второй остаётся candidate group и ждёт подтверждения. Так конвейер ускоряется на очевидных случаях и не рискует склеивать variants ради красивого процента автоматизации.
Проверяемые источники: GS1 — Ready to sell? Start with a GS1 barcode/GTIN · GS1 — Allegro: Enhancing online shopping with trusted data
Что проверить перед следующей партией
Как найти дубли товаров в каталоге?
Сначала использовать сильные identifiers и product facts, затем text/semantic similarity для поиска дополнительных candidates. Финальное решение должно учитывать variant-defining attributes.
Можно ли склеивать товары с одинаковым GTIN?
Совпадающий корректный GTIN — сильный сигнал, но при конфликтующих данных его всё равно стоит проверить. Грязные supplier feeds могут содержать ошибочные identifiers.
Как отличить дубль от варианта товара?
Определить поля, которые формируют variant: размер, цвет, объём, комплектацию или другие признаки категории. Совпадающий parent product ещё не означает одинаковый sellable SKU.
Дедупликация для меня успешна, когда каталог становится чище, но не беднее. Система быстро собирает кандидатов, показывает реальные различия, а редактор принимает решение на группе. Дубли исчезают. Варианты остаются.
Следующие задачи в каталожном потоке для «дубли товаров в каталоге»: Атрибуты товара: как нормализовать характеристики от разных поставщиков с AI · Интеграция с маркетплейсами: как синхронизировать карточки без ручного копирования · AI shopping: как подготовить каталог товаров для shopping-агентов.
Источники и методическая база
- Product Variant Structured DataGoogle Search Central
- Ready to sell? Start with a GS1 barcode/GTINGS1
- Allegro: Enhancing online shopping with trusted dataGS1
- Designing a URL structure for ecommerce sitesGoogle Search Central

