Перейти к содержимому
DedicatedPHP Контакт
Собственный продукт · Электронная коммерция и данные

Comparor: преобразование разнородных источников в сопоставимую информацию.

Программа Comparor объединяет в себе функции сбора, нормализации, поиска и обновления данных. Это программное обеспечение, ценность которого зависит как от качества данных, так и от приложения, использующего их.

ДоменСравнение товаров
ВозможностиСбор, сканирование, обработка данных и поиск.
ПроектыАвтоматизация и операции
Контекст

Проблема, лежащая в основе продукта.

Коммерческие источники меняют структуру, доступность и частоту поставок. Для обеспечения полезного сравнения система должна учитывать происхождение, свежесть и качество для каждого параметра, поддерживая при этом рабочие процессы, которые могут частично давать сбои.

  • Вносите каталоги различных форматов и качества.
  • Обнаружение изменений в исходном коде без нарушения всего потока данных.
  • Нормализация товаров и их характеристик с сохранением отслеживаемости.
  • Обновление информации при контролируемых эксплуатационных расходах.
  • Разделяйте временную недоступность и постоянный сбой.
Прикладная работа

Возможности, встроенные в систему

В описании рассматриваются только наблюдаемые возможности, и не приводятся данные о недокументированных метриках.

Приобретение

Соединители, сканирование и импорт с использованием системы контроля версий.

Нормализация

Преобразовывать поля, категории, единицы измерения и атрибуты.

Качество

Проверка данных, состояния и обработка неполных записей.

Обработка

Возобновляемые пакетные задания с возможностью повторных попыток и ограничениями.

Запрос

Структуры, оптимизированные для поиска и сравнения.

Операции

Мониторинг источника, ошибок, охвата и свежести.

Концептуальная архитектура

Как распределяются обязанности

Это объяснительная модель, а не воспроизведение конфиденциальной инфраструктуры.

  1. Процесс обработки данных разделен на этапы: сбор данных, проверка, нормализация и публикация.
  2. Для пояснения каждого значения сохранены источник и штат.
  3. Пакетные задания можно возобновить без повторного выполнения всей работы.
  4. Модель чтения оптимизирована для удобства поиска.
Доказуемый результат

Что демонстрирует этот опыт

  • Архитектура, разделяющая качество данных и их представление.
  • Возможность добавлять или исправлять источники без перепроектирования продукта.
  • Опыт работы с каталогами, импортом, поиском и обработкой больших объемов данных.
Уроки

Принципы повторного использования

В конвейере обработки данных необходимо объяснить, почему запись не была опубликована.

Наблюдаемость по каждому источнику более полезна, чем глобальная частота ошибок.

Для нормализации необходимы не только технические преобразования, но и бизнес-решения.

Первый разговор

Давайте обсудим, что нужно вашему PHP-приложению.

Расскажите нам о контексте, основной проблеме и желаемом результате. Мы ответим вам, задав вопросы, необходимые для проведения первоначальной оценки.

  • Никаких коммерческих обязательств
  • Непосредственный контакт с командой
  • Ваши данные не продаются третьим лицам.
Поля, отмеченные *, обязательны для заполнения.