Как маркетплейс USmall обрабатывает 70 млн запросов в день

Кейс USmall по построению отказоустойчивой инфраструктуры в облаке Timeweb Cloud. Затраты -35%, аптайм 99,98%, масштабирование за 2 минуты

Маркетплейс USmall продаёт товары зарубежных брендов. 130 крупных ритейлеров, 6+ миллионов товаров, 10-12 миллионов вариантов (размеры, цвета, модификации). Каталог обновляется автоматически — цены, скидки, остатки. И всё это работает без выделенной DevOps-команды.

Рассказываю, как ребята построили отказоустойчивую инфраструктуру в облаке Timeweb Cloud, обрабатывают до 70 млн запросов в день и экономят 35% по сравнению с предыдущим провайдером.


О компании и задаче

USmall — маркетплейс, который свозит товары от 130 зарубежных ритейлеров в одну витрину.

Своя ИТ-система синхронизирует каталог в двух режимах:

  • по расписанию
  • по действиям пользователя (открыл карточку товара, оформил заказ)

Ключевая проблема: инфраструктура должна быть отказоустойчивой. Один час недоступности системы = шесть часов задержки обновления каталога. Клиенты увидят неактуальные цены — уйдут к конкурентам.

Требования:

  • стабильная работа при memory-intensive нагрузках (парсинг HTML-страниц требует много RAM)
  • масштабирование за минуты (каждую неделю подключают 2-3 новых площадки)
  • быстрая поддержка (не ждать ответа на тикет 3-4 дня, как у предыдущего провайдера)
  • управление без DevOps-команды (самостоятельно, через понятный UI)

Архитектура решения

В основе — микросервисы в Managed Kubernetes. Для каждой из 130 торговых площадок — свой контур обработки данных, свой репозиторий и Docker-образ.

Это позволяет:

  • делать независимые релизы
  • изолировать изменения
  • гибко настраивать логику под каждый источник

Слои обработки:

  • синхронизация данных о товарах — на базе кастомизированного Scrapy
  • для площадок со сложной клиентской логикой — headless-браузер
  • оркестрация — Apache Airflow 2.0
  • управление приложениями в кластере — Rancher (self-hosted)
  • CI/CD и хранение Docker-образов — GitLab

Собственная разработка: механизм иерархических подов (родительский под запускает дочерние). Это обходит ограничения Python по пропускной способности одного воркера и позволяет параллельно запускать много независимых задач.

AI-модуль (в тестовом режиме): ускоряет подключение новых интернет-магазинов. Запущен внутри Kubernetes-кластера.


Почему выбрали Timeweb Cloud

1. Надёжная инфраструктура

Облако распределено по нескольким дата-центрам. Каналы зарезервированы — при проблемах трафик мгновенно переключается на резервные. Оборудование поддерживает 400 Гбит/с.

2. Качество поддержки и гибкость

Prime-поддержка — личный чат с топ-менеджерами и инженерами. Когда USmall понадобилась нестандартная конфигурация под высоконагруженный оркестратор, провайдер оперативно собрал выделенный сервер.

3. Удобные интерфейсы

Панель управления интуитивно понятная. Чтобы добавить ноды в Kubernetes-кластер, команде USmall нужно 1-2 минуты. DevOps-команда не нужна.

4. Экосистема и цена

40+ сервисов в одном личном кабинете (готовые серверы с предустановленным ПО, базы данных, хранилища). Не надо интегрировать несколько API. По сравнению с предыдущим партнёром — снижение затрат на 35% при том же объёме и качестве услуг.


Как выглядит инфраструктура сейчас

Ядро системы — Managed Kubernetes:

  • 13 высокопроизводительных нод
  • базовая конфигурация ноды: 32 CPU, 64 ГБ RAM
  • отдельные ноды масштабируются до 128 ГБ RAM (для самых требовательных задач)
  • в пике — 450 ядер CPU и 1 ТБ оперативной памяти

Выделенный сервер под оркестратор:

  • Airflow перенесён на сервер с двумя процессорами по 32 ядра (нестандартная конфигурация)
  • Миграция прошла без простоя

VDS и облачные базы данных:

  • для тестирования open-source решений
  • для быстрого развёртывания прототипов

Результаты (цифры)

Показатель Значение
Ежедневно HTTP-запросов 50 млн (в распродажи — до 70 млн)
Аптайм системы синхронизации 99,98%
Рост кластера за время сотрудничества в 2 раза
Время масштабирования 2 минуты (в панели управления)
Экономия по сравнению с прошлым провайдером 35%
Критических простоев 0

Пиковая нагрузка: система одновременно синхронизирует данные более 2 млн товаров.


Что дальше (планы)

  1. Рост каталога — каждую неделю подключают 2-3 новых площадки. Нужно добавлять ноды и увеличивать RAM в Kubernetes-кластере.
  2. Новая версия архитектуры — собственный движок вместо Scrapy. Для этого — дальнейшее масштабирование Kubernetes и увеличение ресурсов для Airflow.
  3. AI-направление — обучение моделей, интеллектуальный поиск, развитие чат-бота. Потребуется GPU-инфраструктура провайдера.
  4. Рост managed-сервисов — увеличение количества облачных баз данных под новые проекты.

Цитата

«В ИТ нет выходных. Поэтому облачный провайдер должен сочетать надёжную инфраструктуру с быстрой поддержкой и удобным пользовательским интерфейсом. Timeweb Cloud закрывает все эти вопросы, что напрямую влияет на стабильность бизнеса USmall.» — Станислав Наумов, руководитель отдела Python-разработки USmall


Если коротко

USmall построил отказоустойчивый бэкенд для highload-маркетплейса на базе Managed Kubernetes от Timeweb Cloud. 450 ядер CPU, 1 ТБ RAM, 99,98% аптайма, 70 млн запросов в пик, масштабирование за 2 минуты без DevOps-команды.

Ключевые факторы успеха:

  • распределённая инфраструктура с резервными каналами
  • гибкость провайдера (собрали выделенный сервер под нестандартную задачу)
  • личная поддержка топ-менеджеров и инженеров (prime-поддержка)
  • единая экосистема (40+ сервисов в одном окне)
  • экономия 35% при лучшем качестве

Вывод для тех, кто строит highload: облако выигрывает не ценой виртуалок, а стабильностью, скоростью поддержки и возможностью масштабироваться за минуты без найма DevOps-команды. И не стесняйтесь просить у провайдера нестандартные конфигурации — нормальные компании собирают серверы под ваш конкретный случай.

Облачная инфраструктура для бизнеса

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

Кнопка «Наверх»