E-commerce
ГайдКак наполнить интернет-магазин товарами
Наполнение интернет-магазина товарами — парсинг, XML/YML-фиды поставщиков и руками. Риски по закону и политикам Google, требования Rozetka и Hotline.

Магазин готов, дизайн согласован, оплата работает. А проект стоит третью неделю, потому что в каталоге 12 товаров из 3000. В наших запусках это самая частая причина сдвига дедлайна: наполнение интернет-магазина товарами планируют последним, хотя оно съедает больше часов, чем вся разработка витрины.
Путей заполнить каталог ровно три: спарсить чужой сайт, забрать данные из фида поставщика или маркетплейса, завести всё руками. Подрядчики, которые продают парсинг, подробно описывают первый и молчат про два других. А главное — молчат о том, чем за первый платят. Дальше все три без прикрас: нормы права, требования конкретных площадок и цифры оттуда, где их можно проверить.
Если магазина ещё нет, сначала посмотрите, как создать интернет-магазин с нуля — там этапы запуска, и наполнение в них лишь один шаг из девяти.
Путь 1. Парсинг чужого каталога: быстро, дёшево и с двумя счетами потом

Механика проста настолько, что соблазняет. Разработчик пишет скрипт, тот обходит каталог конкурента или крупного маркетплейса, вытаскивает названия, характеристики, цены, описания и ссылки на фото и складывает это в CSV или сразу в базу. Тысяча товаров переезжает за ночь.
Цены на эту услугу открытые. Horoshop продаёт парсинг товаров с внешних сайтов от 6000 грн за первый сайт-донор — в базу входит до 10 000 товаров, дальше +100 грн за каждую тысячу, дополнительный донор +2000 грн. Каталог на 5000 позиций с одного донора укладывается в базовые 6000 грн и несколько дней работы. Сравните с любой оценкой ручной работы на том же объёме, и выбор выглядит очевидным.
Очевидным он перестаёт быть, когда распишешь второй и третий счёт.
Что говорит закон о базе данных, из которой вы берёте
Каталог товаров — это не просто набор строк. Украинский закон разводит здесь две разные вещи, и путать их дорого.
Первая — авторское право на контент внутри каталога. К объектам авторского права закон относит письменные произведения, в частности статьи в письменной, электронной (цифровой) или иной форме, и отдельной строкой фотографические произведения. Развёрнутое описание, которое написал контент-менеджер конкурента, и студийное фото с его предметной съёмки — это оно и есть.
Вторая вещь интереснее, и о ней в блогах подрядчиков не пишут. Это право на саму базу. Авторским правом база данных охраняется только если подбор и упорядочение её составных частей — результат творческой деятельности. Сам факт, что кто-то собрал 5000 товаров в каталог, этого не даёт. На этом месте аргумент «каталог не охраняется» обычно и останавливается.
Но в статье 21 есть вторая половина. Изготовителю базы данных, который внёс качественно и/или количественно значительный вклад в получение, проверку или представление содержимого базы, для предотвращения извлечения и/или повторного использования предоставляется право особого рода, sui generis. Перечитайте формулировку: она написана буквально под ситуацию «кто-то выгрузил мой каталог». Действует это право 15 лет, а любое существенное изменение содержимого базы, в том числе через накопление дополнений, даёт ей новый собственный срок охраны — так прямо написано в части восьмой той же статьи 21.
Норма не украинская выдумка, она гармонизирована с европейской. Директива 96/9/EC определяет «извлечение» как постоянный или временный перенос всего или существенной части содержимого базы данных на другой носитель любым способом и в любой форме. Любимое «мы же не копировали сайт, мы сделали к нему запрос» — это и есть перенос любым способом.
Самая популярная лазейка закрыта отдельно. Директива запрещает и повторяющееся, систематическое извлечение несущественных частей содержимого, если оно противоречит нормальной эксплуатации базы или неоправданно вредит законным интересам её изготовителя. Схему «берём по 200 товаров в день, чтобы не было существенной части» текст директивы описывает прямо, и именно как нарушение.
История, которой прикрывают парсинг, закончилась не так
В FAQ сервисов парсинга почти всегда есть строка «скрейпинг публичных данных законен, есть прецедент hiQ против LinkedIn». Прецедент действительно есть. Вот чем он закончился для hiQ.
В ноябре 2022 года суд удовлетворил иск LinkedIn за нарушение пользовательского соглашения: автоматизированный сбор профилей признан нарушением договора. Нюанс на стороне скрейперов в деле тоже остался: по американскому CFAA сбор публично доступных данных преступлением не признали. Но решил дело не CFAA, а обычный договор — правила пользования сайтом, которые вы принимаете самим фактом пользования.
Разница вышла дорогой. Судебное решение на 500 тысяч долларов против hiQ, ответственность по калифорнийским деликтам trespass to chattels и misappropriation, запретительные меры, которые фактически закрывают LinkedIn для парсинга навсегда. Компания обязалась навсегда прекратить скрейпинг и удалить весь код, данные и алгоритмы, созданные и полученные в процессе.
Украинскому магазину на 3000 SKU полумиллионный иск не грозит: юрисдикция другая, масштаб другой. Грозит сама конструкция. Публичность данных не делает сбор разрешённым, когда есть договорные условия и право изготовителя базы.
Второй счёт — от Google, и он приходит быстрее
Юридический риск вероятностный: правообладатель может и не заметить. Поисковый не такой, потому что Google по определению смотрит на все каталоги сразу.
В спам-политиках Google Поиска скрейпинг определён как «taking content from other sites, often through automated means, and hosting it with the purpose of manipulating search rankings». То есть именно то, что делает магазин, который залил чужой каталог, чтобы быстрее начать ранжироваться.
Дальше политика перечисляет конкретные практики, и каждая узнаётся с первой строки. Нарушением названо «republishing content from other sites without adding any original content or value» и отдельно — «reproducing content feeds from other sites without providing some type of unique benefit to the user». Дословное копирование описания у производителя без добавленной ценности подпадает под определение thin affiliation: описания и обзоры, скопированные прямо у оригинального продавца, без собственного контента и добавленной пользы.
Самый важный для практики пункт касается рерайта. Стандартный совет «спарсим и прогоним через синонимайзер» ломается о прямую цитату: к скрейпингу Google относит и практику «copying content from other sites, modify it only slightly (for example, by substituting synonyms or using automated techniques), and republish it». Лёгкий рерайт — это не обход политики, это пример из самой политики.
И финальный штрих для тех, кто генерирует из фида тысячи страниц: «scraping feeds, search results, or other content to generate many pages… where little value is provided to users» квалифицируется как scaled content abuse.
Переписать описания действительно можно. Но это отдельная работа с отдельной стоимостью, а не бесплатное приложение к парсеру. Как устроены генерация и редактура описаний в промышленных объёмах, мы разобрали на странице AI-контента. Здесь важно одно: строку «переписать 3000 описаний» нужно заложить в смету сразу, иначе экономия на парсинге съедается целиком.
Третий счёт — от маркетплейса
Если вы продаёте не только на своём сайте, у спарсенного контента есть ещё один контролёр. Rozetka по жалобе правообладателя прячет товары продавца, которые нарушают авторское право: в кабинете они так и помечаются как скрытые модератором. Жалоба конкурента, чьи фото вы взяли, срабатывает быстрее любого суда.
Схема «один спарсенный фид в несколько витрин» закрыта отдельно. Маркетплейс запрещает создание нескольких магазинов с идентичным ассортиментом, потому что это засоряет поиск. Продажа дропшип-товаров там тоже запрещена: товары прячут, а сотрудничество могут разорвать в одностороннем порядке.
Честный итог. Парсинг — самый быстрый способ получить структуру каталога и характеристики. Но как способ получить готовый к продаже контент он оплачивается дважды: переписыванием и риском.
Путь 2. Фиды поставщиков и маркетплейсов — штатный путь, о котором молчат
Вот что удивляет больше всего. Сервисы парсинга подробно объясняют, как собрать данные с чужого сайта, и почти никогда не упоминают, что поставщик вполне легально отдаёт те же самые данные сам: файлом, по расписанию и со своего согласия.
Формат обмена товарными данными в Украине сложился вокруг XML в диалекте YML. Поставщик даёт ссылку на файл, ваш магазин забирает его по расписанию, сверяет позиции по идентификатору и обновляет цены, остатки и новые товары. Это не хак, а предусмотренный способ работы, под который у платформ есть штатные инструменты. Что из этого поддерживает ваша CMS, стоит проверять ещё на этапе выбора: на чём сделать интернет-магазин и как выбрать платформу для интернет-магазина — об этом в отдельных статьях, здесь только то, что касается каталога.
Как это выглядит в WooCommerce
В WooCommerce импорт встроенный. CSV-импортер позволяет массово загружать большие объёмы товаров вместе с атрибутами, категориями и изображениями. Обязательных колонок в файле всего две: SKU, который генерируется автоматически, если его нет, и Name. Остальные поля опциональны, так что начать можно с минимального файла и доливать данные итерациями.
Для регулярной работы главное — повторный импорт. Существующие товары, которые совпадают по ID или SKU, обновляются, а отсутствующие пропускаются. Именно на этом строится ежедневное обновление цен и остатков из файла поставщика: один и тот же файл заливаете по расписанию, ничего не дублируется.
Грабли тоже документированы. Максимальный размер файла задаёт не плагин, а сервер, поэтому большой каталог делят на части и первый раз заливают на staging, а не в боевом магазине.
В OpenCart всё иначе, чем часто описывают: импорт там делают через расширение из маркетплейса, а не встроенным инструментом из коробки. Это не минус, но отдельная строка в смете и отдельная точка отказа при обновлении платформы.
Требования Rozetka — самые строгие, и по ним удобно калиброваться
Если вы строите фид так, чтобы он прошёл на Rozetka, он почти наверняка пройдёт везде.
Автоматизированно маркетплейс принимает товары только в XML (YML) и только в одной кодировке: допустимая кодировка данных — только UTF-8. Идентификатор товара допускает лишь символы Aa-Zz и 0-9, то есть никакой кириллицы в артикулах, и после загрузки товара его уже не изменить. Это самая дорогая из всех мелких ошибок: неправильная схема ID означает перезаливку каталога с нуля.
Изображений на товар от 1 до 15, размер — минимум 400×400 px, максимум 4000×4000 px при оптимальном квадрате 1000×1000, вес одного файла до 10 МБ, форматы JPEG, GIF, PNG и WebP.
Описание товара ограничено 50 000 символами, места более чем достаточно. А вот запрещённый список стоит прочитать до того, как контент-менеджер напишет первое описание: нельзя ссылки на сторонние ресурсы, цены и информацию о других товарах, изображения, видео, эмодзи, данные о доставке и способах оплаты, контакты магазина, цветной текст. Магазины регулярно ловят отказ модерации именно на «бесплатная доставка от 1000 грн» внутри описания.
Hotline и Google Merchant Center
У прайс-агрегатора ограничения свои. Товарный фид Hotline не должен превышать 150 тысяч товаров; форматы принимаются шире — XML, YML, CSV, XLS и TXT, кодировка UTF-8 или windows-1251, а обновлять предложения разрешено несколько раз в сутки. Для изображений требование, которое сразу отсеивает чужие фото: реальные фотографии товара на белом фоне, без логотипов, текста и водяных знаков.
Google Merchant Center формализует то же самое на своей стороне. Описание — обязательный атрибут, максимум 5000 символов, и в нём нельзя ссылок на ваш магазин, информации об акциях, упоминаний конкурентов, других товаров или аксессуаров. Название — до 150 символов. Изображение не может содержать рекламного текста, водяных знаков или рамок, и заглушку вместо фото подавать нельзя.
Один пункт занесите в календарь прямо сейчас. Google будет требовать изображение товара минимум 500×500 пикселей, и требование вступает в силу 31 января 2027 года. Если ваш каталог собран из старых фото 300 px по длинной стороне, пересъёмка становится задачей на 2026 год, а не сюрпризом в январе 2027-го.
Для товарных результатов в самом поиске обязательный минимум ещё скромнее: merchant listing требует Offer, потому что продавцом товара должны быть именно вы. То есть name, image и offers с ценой и валютой, остальные поля рекомендованные.
Итог пути. Красивых описаний фид не даёт. Он даёт точные данные, законный источник и механизм обновления — фундамент, на который ложится всё остальное.
Путь 3. Руками — когда товаров мало или они ваши

Ручное наполнение выглядит архаично ровно до тех пор, пока не посчитать, чего оно избегает: согласования форматов, разбора чужого XML, переписывания описаний и рисков из двух предыдущих разделов. На каталоге до 200–300 позиций руки часто финишируют раньше автоматики, потому что у автоматики есть своя фаза настройки, которую никто не закладывает в оценку.
О цене скажу честно. Цифр «стоимость за SKU» из чужих блогов мы сознательно не приводим: их публикуют те же подрядчики, которые эту услугу продают, и проверить методику невозможно. Считайте в своих часах. Возьмите десять реальных товаров, заведите их полностью — название, характеристики, описание, фото, категории, SEO-поля — и засекайте время. Эта цифра, умноженная на каталог, будет точнее любого чужого бенчмарка.
Главный аргумент за ручной путь даже не в деньгах. Он в том, что конкуренты эту часть делают плохо. По бенчмарку Baymard, 10% крупных интернет-магазинов имеют описания товаров, недостаточные для нужд пользователя, и это видно в поведении покупателей. Участник тестирования, сравнивая два кресла, сформулировал свой выбор прямо: [«There's a lot of information here, on the chair… I'm starting to discount [the other chair], because there's very little information»](https://baymard.com/blog/product-descriptions). Товар проиграл не ценой и не фото, а объёмом информации.
Вторая цифра ещё интереснее. Структурируют описание по ключевым характеристикам лишь 22% сайтов; остальные 78% оставляют сплошную стену текста даже на топовых товарах. Реакция пользователя в тестах такая же прямая: «It's like… all of this text… you don't really want to read it».
Ситуация выходит парадоксальная. Скопированное описание от производителя карается Google, а собственное, но неструктурированное, игнорируется покупателем. Выигрывает третий вариант, которого почти никто не делает: короткие highlights сверху, развёрнутый текст ниже.
Три пути рядом
| Парсинг | Фиды поставщиков | Руками | |
|---|---|---|---|
| Скорость | Самая высокая: тысячи позиций за ночь | Средняя: 1–3 дня на настройку, дальше автоматически | Самая низкая: часы на каждые 10 товаров |
| Юридические риски | Высокие: право sui generis изготовителя базы (15 лет), нарушение условий пользования, жалобы правообладателей | Минимальные: данные передаёт владелец по собственному согласию | Отсутствуют |
| SEO-последствия | Дубли и scraped content в спам-политиках Google; рерайт синонимами политику не обходит | Нейтральные: данные точные, но описания одинаковые у всех, кто взял тот же фид | Лучшие: собственный текст, дублей нет |
| Обновление цен и остатков | Нужно строить и поддерживать парсер | Штатное: повторный импорт по ID/SKU | Ручное, не масштабируется |
| Когда уместно | Разведка рынка, сбор структуры категорий и характеристик — как черновик, не как контент | Основной рабочий путь для любого каталога от нескольких сотен позиций | Каталог до 200–300 позиций, редкие товары или собственное производство, топ-товары в любом магазине |
Что с этим делать на практике
Рабочий ответ почти всегда комбинированный, и последовательность у него такая.
Сначала фид. Просите у поставщика XML/YML или CSV, настраиваете импорт по ID/SKU и получаете скелет каталога с точными данными и механизмом обновления. Это база, и она законна.
Дальше описания. Фид даёт технические данные, но текст в нём тот же, что и у всех ваших конкурентов с тем же поставщиком. Переписывайте не всё сразу, а по приоритету: сначала 50–100 товаров, которые приносят деньги, потом остальные. И структурированно: highlights сверху, детали ниже.
Парсинг остаётся инструментом разведки, а не наполнения. Посмотреть, как конкурент раскладывает категории, какие характеристики считает важными, где у него фильтры. Это аналитика, и в ваши страницы она дословно не переезжает.
Отдельно фото. Здесь компромисса обычно нет: чужие снимки не пройдут ни требование Hotline об отсутствии водяных знаков, ни запрет Google на рамки и рекламный текст, ни жалобу правообладателя на Rozetka. Предметная съёмка — строка бюджета, которую придётся заложить.
Если вы сейчас на этапе, где наполнение интернет-магазина товарами нужно оценить в деньгах и неделях, напишите нам. Посмотрим ваш каталог и источники данных и скажем, что из этого автоматизируется, а что придётся делать руками.
Частые вопросы
Законно ли парсить сайт конкурента?
Публичность данных сама по себе разрешения не даёт. По статье 21 закона «Об авторском праве и смежных правах» изготовитель базы данных, который внёс значительный вклад в её наполнение или проверку, имеет право особого рода (sui generis) именно для предотвращения извлечения и повторного использования содержимого. Действует оно 15 лет, а существенное изменение содержимого базы даёт ей новый срок охраны (ч. 8 ст. 21). Отдельно работают условия пользования сайтом: в деле hiQ против LinkedIn решающим оказался именно договор, а не компьютерное законодательство. Оценку конкретной ситуации должен давать юрист, а не подрядчик, который продаёт парсинг.
Мы берём по 100 товаров в день, а не весь каталог. Это уже не «существенная часть»?
Директива ЕС 96/9/EC в статье 7(5) отдельно запрещает повторяющееся и систематическое извлечение несущественных частей, если оно противоречит нормальной эксплуатации базы или вредит законным интересам её изготовителя. То есть дробление описано в тексте нормы прямо и не как исключение.
Если переписать спарсенные описания синонимами — Google это пропустит?
Нет. В спам-политиках Google пример скрейпинга сформулирован дословно как копирование с незначительной модификацией, в том числе заменой синонимов или автоматическими техниками. Это не серый метод — это описанный в политике пример нарушения.
Сколько стоит наполнение каталога?
Автоматическую часть считают прозрачно: у Horoshop парсинг начинается от 6000 грн за первый сайт-донор (до 10 000 товаров в базе, дальше +100 грн за тысячу). Ручную часть корректно считать в своих часах — заведите десять товаров полностью, засеките время и умножьте. Чужих бенчмарков «за SKU» мы не приводим: их публикуют те, кто эту услугу продаёт.
Можно ли залить один и тот же фид в свой магазин и на Rozetka?
На маркетплейсе — с ограничениями. Rozetka запрещает создание нескольких витрин с идентичным ассортиментом и продажу дропшип-товаров, а по жалобе правообладателя прячет товары, которые нарушают авторское право. Технически фид один, содержательно карточки должны отличаться.
Какой минимум данных нужен, чтобы начать?
В WooCommerce обязательных колонок в CSV всего две — SKU и Name; SKU даже сгенерируется автоматически, если его нет. Для Google Merchant Center минимум строже: описание обязательно и ограничено 5000 символами, название — 150 символами. Стартовать можно с минимального файла и доливать поля итерациями.
Какие требования к фото, чтобы не переделывать каталог дважды?
Ориентируйтесь на самые строгие. Rozetka принимает от 400×400 до 4000×4000 px, до 10 МБ, от 1 до 15 фото на карточку. Hotline требует реальные фото на белом фоне без логотипов и водяных знаков. Google будет требовать минимум 500×500 px с 31 января 2027 года. Квадрат 1000×1000 без посторонних надписей закрывает все три.
Сколько описаний переписывать, если их тысячи?
Не все и не сразу. Сначала 50–100 товаров, которые приносят основную выручку, и структурированно: короткие highlights сверху, детали ниже. По данным Baymard, так делает лишь 22% сайтов, так что это одно из немногих преимуществ, которое ещё можно получить простой работой.
Была ли статья полезной?
Похожие статьи
E-commerceContent API for Shopping выключают 18 августа 2026
Гайд9 мин чтения
18 августа 2026 Google выключает Content API for Shopping. Две проверки в Merchant Center за пять минут покажут, касается ли это вашего магазина.
E-commerceПочему поиск в магазине не находит товар, который есть на складе
Гайд17 мин чтения
Товар на складе, а поиск по сайту интернет-магазина отдаёт ноль. Восемь классов поломки: типы запросов, опечатки, транслитерация, лживые счётчики фильтров.
E-commerceПоиск запчастей по VIN-коду в магазине, и почему он то спасает, то подводит
Гайд14 мин чтения
Поиск запчастей по VIN-коду узнаёт авто, но не деталь. Что кодируют 17 символов, почему бесплатный декодер не поможет и откуда берутся данные совместимости.