Fetch Rewards обрабатывает более 11 миллионов чеков ежедневно для 18 миллионов активных пользователей. Компания мигрировала со стороннего AI-решения, которое работало как чёрный ящик, на собственный ML-пайплайн на Amazon SageMaker, Hugging Face Transformers и AWS Inferentia. Результат: время разработки сократилось на 30%, задержка обработки снизилась на 50%, а проект завершили за 8 месяцев вместо запланированных 12.
Ключевой мотив миграции - потребность в гранулярности данных для бизнес-партнёров. Сторонний сервис не раскрывал внутренние механизмы распознавания, что ограничивало кастомизацию и аналитику. Собственная инфраструктура дала полный контроль над моделями и данными. В этом разборе - архитектура решения, метод безопасного переключения через shadow pipeline и цифры, которые объясняют выгоду от владения AI-инфраструктурой.
Почему Fetch Rewards отказались от чёрного ящика
Fetch Rewards строит бизнес на обработке чеков: пользователи сканируют покупки, система распознаёт позиции, начисляет баллы. При 11 миллионах чеков ежедневно каждая миллисекунда задержки и каждый процент точности распознавания напрямую влияют на пользовательский опыт и операционные расходы.
Стороннее AI-решение справлялось с базовой задачей, но имело три ограничения. Первое: отсутствие гранулярности данных. Бизнес-партнёрам Fetch Rewards нужна детальная аналитика по товарам, категориям и брендам, а чёрный ящик выдавал только агрегированные результаты. Второе: невозможность кастомизации. Команда не могла дообучить модель под специфические форматы чеков или новые категории товаров. Третье: зависимость от вендора. Любое изменение требовало ожидания от сторонней команды, что замедляло итерации.
Решение построить собственный пайплайн стало логичным шагом для компании, которая хочет управлять качеством распознавания и аналитикой на уровне отдельных позиций в чеке. Это закрывает боль, знакомую многим ML-командам: внешние API удобны на старте, но ограничивают рост, когда требования к данным и скорости выходят за рамки стандартного сервиса.
Архитектура нового ML-пайплайна на AWS и Hugging Face
Новая система объединяет три ключевых компонента: Amazon SageMaker для оркестрации ML-жизненного цикла, Hugging Face Transformers для моделей и AWS Inferentia для аппаратного ускорения инференса. Каждый слой решает свою задачу, а интеграция между ними обеспечивает сквозной процесс от данных до продакшена.
Amazon SageMaker как основа пайплайна
SageMaker взял на себя управление обучением, тюнингом и развертыванием моделей. Платформа обеспечила масштабируемость: при 11 миллионах чеков ежедневно пайплайн должен обрабатывать пиковые нагрузки без деградации. SageMaker также упростил версионирование моделей и мониторинг качества, что критично для продакшена с высоким трафиком.
Для команд, которые рассматривают миграцию с внешних AI-сервисов, SageMaker закрывает базовые потребности MLOps: управляемые инстансы для обучения, автоматическое масштабирование инференса и интеграцию с другими сервисами AWS. Это снижает порог входа в собственную инфраструктуру.
Hugging Face Transformers для моделей
Библиотека Hugging Face Transformers дала доступ к предобученным моделям и инструментам для файнтюнинга. Вместо разработки архитектур с нуля команда Fetch Rewards использовала проверенные трансформеры и адаптировала их под задачу распознавания чеков. Это сократило время экспериментов и позволило сосредоточиться на качестве данных и специфике домена.
Отдельную роль сыграла Hugging Face Expert Acceleration Program. Программа обеспечила передачу знаний инженерной команде: эксперты Hugging Face помогли быстрее освоить тонкости файнтюнинга, оптимизации пайплайнов и работы с open-source инструментами. Это ускорило выход на продакшен и снизило риски типичных ошибок при первом построении собственного ML-стека. Подробнее о стратегическом партнёрстве Hugging Face и AWS можно прочитать в анализе huggingface_hub v1.0, где разобраны технические детали работы с open-source моделями.
Ускорение инференса с AWS Inferentia
Инференс на CPU или GPU общего назначения не давал нужной задержки при обработке 11 миллионов чеков ежедневно. Чипы AWS Inferentia, спроектированные специально для ML-инференса, снизили задержку обработки на 50%. Это прямое влияние на пользовательский опыт: чем быстрее система распознаёт чек, тем быстрее пользователь получает баллы.
Inferentia также сократила стоимость инференса. Для высоконагруженных систем с миллионами запросов в день разница в цене за миллион инференсов между GPU и специализированными чипами становится существенной статьёй бюджета. Практический опыт деплоя NLP-моделей с фокусом на задержку и стоимость разобран в материале про Hugging Face Inference Endpoints.
Безопасное переключение: shadow pipeline в действии
Миграция продакшена без остановки обработки чеков - главный риск любого проекта такого масштаба. Fetch Rewards использовала shadow pipeline: новая система работала параллельно со старой, прогоняя через себя те же данные, но не влияя на пользовательский трафик.
Схема выглядит так: каждый чек обрабатывается старой системой в продакшене, а копия данных уходит в новый пайплайн. Результаты обеих систем сравниваются по метрикам точности, задержки и полноты распознавания. Когда новая система стабильно показывает результаты не хуже старой, трафик постепенно переключается: сначала 5%, затем 20%, 50% и так далее до полного перехода.
Shadow pipeline дал два преимущества. Первое: возможность отката. Если новая модель ошибается на специфическом формате чека, трафик мгновенно возвращается к старой системе. Второе: накопление реальных данных для сравнения. Вместо синтетических тестов команда видела поведение новой системы на живом трафике, что снизило неопределённость при финальном переключении.
Результаты миграции: цифры и факты
Проект завершили за 8 месяцев вместо запланированных 12. Ускорение на треть стало следствием двух факторов: правильного выбора инструментов и экспертной поддержки Hugging Face Expert Acceleration Program, которая сократила время на освоение технологий.
Ключевые метрики:
- Время разработки сократилось на 30%.
- Задержка обработки снизилась на 50% благодаря AWS Inferentia.
- Обучение моделей ускорилось с дней до часов.
- Полный контроль над AI-инфраструктурой: от данных до моделей и инференса.
Цифры показывают прямую выгоду от владения ML-стеком. Сокращение задержки на 50% при 11 миллионах чеков ежедневно - это миллионы сэкономленных секунд пользовательского ожидания. Обучение за часы вместо дней позволяет быстрее адаптироваться к новым форматам чеков и требованиям бизнес-партнёров. Оценку выгоды от open-source моделей с конкретными цифрами затрат можно найти в разборе кейса Databricks, где открытая модель показала сопоставимое качество при затратах в 4 раза ниже проприетарной.
Уроки и лучшие практики для вашей миграции
Первый урок: контроль над данными и моделями - это стратегический актив. Fetch Rewards смогла предоставить бизнес-партнёрам гранулярную аналитику только после того, как получила доступ к внутренним представлениям модели. Сторонние сервисы редко дают такой уровень прозрачности.
Второй урок: экспертная поддержка ускоряет миграцию. Hugging Face Expert Acceleration Program сократила время освоения технологий и помогла избежать типичных ошибок при первом построении ML-пайплайна. Для команд без глубокого опыта в MLOps такая поддержка может быть решающим фактором между успехом и затянувшимся проектом.
Третий урок: shadow pipeline обязателен для миграции высоконагруженных систем. Параллельный прогон данных и постепенное переключение трафика снижают риски до приемлемого уровня. Это стандартная практика для продакшена, где простой недопустим.
Четвёртый урок: выбор инструментов под задачу. SageMaker для оркестрации, Hugging Face Transformers для моделей, Inferentia для ускорения - каждый компонент решает конкретную проблему. Сборка собственного стека из проверенных open-source и облачных решений оказалась быстрее и дешевле, чем разработка с нуля или продолжение работы с чёрным ящиком. О пяти факторах успеха в ML-проектах, включая выбор проекта и команды, можно прочитать в материале с уроками за 8 лет в ML.
Ограничения и потенциальные риски
Открытые материалы по кейсу Fetch Rewards не раскрывают конкретные архитектуры моделей и детальные метрики точности распознавания. Это ограничивает возможность прямого воспроизведения решения, но не отменяет ценность общих принципов: контроль над данными, shadow pipeline, выбор специализированного железа.
Потенциальные риски при подобной миграции:
- Необходимость компетенций в ML-инженерии. Собственный пайплайн требует команды, которая умеет обучать, деплоить и мониторить модели. Без этого проект рискует затянуться.
- Затраты на инфраструктуру. Облачные ресурсы для обучения и инференса стоят денег, и при неправильной оптимизации расходы могут превысить стоимость стороннего сервиса.
- Сложность поддержки. Собственный ML-стек требует постоянного обновления моделей, мониторинга дрейфа данных и реагирования на инциденты. Это операционная нагрузка, которой нет при использовании внешнего API.
Для команд, которые оценивают переход на собственные модели, важно честно посчитать совокупную стоимость владения: инфраструктура, зарплаты, время на поддержку. Если объём данных и требования к кастомизации невелики, сторонний сервис может оставаться более прагматичным выбором. Кейс Fetch Rewards показывает, что при масштабе в 11 миллионов чеков ежедневно и потребности в гранулярной аналитике собственный пайплайн окупается.