Перейти к содержанию
Публикация AiManual

Как Fetch Rewards перешёл с чёрного ящика на собственные ML-модели: кейс миграции на Hugging Face и AWS

Как Fetch Rewards за 8 месяцев построил собственный ML-пайплайн на Amazon SageMaker и Hugging Face: сокращение задержки на 50%, ускорение разработки на 30% и по

Коротко

Что будет в материале

  1. 01

    Почему Fetch Rewards отказались от чёрного ящика

  2. 02

    Архитектура нового ML-пайплайна на AWS и Hugging Face

  3. 03

    Безопасное переключение: shadow pipeline в действии

  4. 04

    Результаты миграции: цифры и факты

Fetch Rewards обрабатывает более 11 миллионов чеков ежедневно для 18 миллионов активных пользователей. Компания мигрировала со стороннего AI-решения, которое работало как чёрный ящик, на собственный ML-пайплайн на Amazon SageMaker, Hugging Face Transformers и AWS Inferentia. Результат: время разработки сократилось на 30%, задержка обработки снизилась на 50%, а проект завершили за 8 месяцев вместо запланированных 12.

Ключевой мотив миграции - потребность в гранулярности данных для бизнес-партнёров. Сторонний сервис не раскрывал внутренние механизмы распознавания, что ограничивало кастомизацию и аналитику. Собственная инфраструктура дала полный контроль над моделями и данными. В этом разборе - архитектура решения, метод безопасного переключения через shadow pipeline и цифры, которые объясняют выгоду от владения AI-инфраструктурой.

Почему Fetch Rewards отказались от чёрного ящика

Fetch Rewards строит бизнес на обработке чеков: пользователи сканируют покупки, система распознаёт позиции, начисляет баллы. При 11 миллионах чеков ежедневно каждая миллисекунда задержки и каждый процент точности распознавания напрямую влияют на пользовательский опыт и операционные расходы.

Стороннее AI-решение справлялось с базовой задачей, но имело три ограничения. Первое: отсутствие гранулярности данных. Бизнес-партнёрам Fetch Rewards нужна детальная аналитика по товарам, категориям и брендам, а чёрный ящик выдавал только агрегированные результаты. Второе: невозможность кастомизации. Команда не могла дообучить модель под специфические форматы чеков или новые категории товаров. Третье: зависимость от вендора. Любое изменение требовало ожидания от сторонней команды, что замедляло итерации.

Решение построить собственный пайплайн стало логичным шагом для компании, которая хочет управлять качеством распознавания и аналитикой на уровне отдельных позиций в чеке. Это закрывает боль, знакомую многим ML-командам: внешние API удобны на старте, но ограничивают рост, когда требования к данным и скорости выходят за рамки стандартного сервиса.

Архитектура нового ML-пайплайна на AWS и Hugging Face

Новая система объединяет три ключевых компонента: Amazon SageMaker для оркестрации ML-жизненного цикла, Hugging Face Transformers для моделей и AWS Inferentia для аппаратного ускорения инференса. Каждый слой решает свою задачу, а интеграция между ними обеспечивает сквозной процесс от данных до продакшена.

Amazon SageMaker как основа пайплайна

SageMaker взял на себя управление обучением, тюнингом и развертыванием моделей. Платформа обеспечила масштабируемость: при 11 миллионах чеков ежедневно пайплайн должен обрабатывать пиковые нагрузки без деградации. SageMaker также упростил версионирование моделей и мониторинг качества, что критично для продакшена с высоким трафиком.

Для команд, которые рассматривают миграцию с внешних AI-сервисов, SageMaker закрывает базовые потребности MLOps: управляемые инстансы для обучения, автоматическое масштабирование инференса и интеграцию с другими сервисами AWS. Это снижает порог входа в собственную инфраструктуру.

Hugging Face Transformers для моделей

Библиотека Hugging Face Transformers дала доступ к предобученным моделям и инструментам для файнтюнинга. Вместо разработки архитектур с нуля команда Fetch Rewards использовала проверенные трансформеры и адаптировала их под задачу распознавания чеков. Это сократило время экспериментов и позволило сосредоточиться на качестве данных и специфике домена.

Отдельную роль сыграла Hugging Face Expert Acceleration Program. Программа обеспечила передачу знаний инженерной команде: эксперты Hugging Face помогли быстрее освоить тонкости файнтюнинга, оптимизации пайплайнов и работы с open-source инструментами. Это ускорило выход на продакшен и снизило риски типичных ошибок при первом построении собственного ML-стека. Подробнее о стратегическом партнёрстве Hugging Face и AWS можно прочитать в анализе huggingface_hub v1.0, где разобраны технические детали работы с open-source моделями.

Ускорение инференса с AWS Inferentia

Инференс на CPU или GPU общего назначения не давал нужной задержки при обработке 11 миллионов чеков ежедневно. Чипы AWS Inferentia, спроектированные специально для ML-инференса, снизили задержку обработки на 50%. Это прямое влияние на пользовательский опыт: чем быстрее система распознаёт чек, тем быстрее пользователь получает баллы.

Inferentia также сократила стоимость инференса. Для высоконагруженных систем с миллионами запросов в день разница в цене за миллион инференсов между GPU и специализированными чипами становится существенной статьёй бюджета. Практический опыт деплоя NLP-моделей с фокусом на задержку и стоимость разобран в материале про Hugging Face Inference Endpoints.

Безопасное переключение: shadow pipeline в действии

Миграция продакшена без остановки обработки чеков - главный риск любого проекта такого масштаба. Fetch Rewards использовала shadow pipeline: новая система работала параллельно со старой, прогоняя через себя те же данные, но не влияя на пользовательский трафик.

Схема выглядит так: каждый чек обрабатывается старой системой в продакшене, а копия данных уходит в новый пайплайн. Результаты обеих систем сравниваются по метрикам точности, задержки и полноты распознавания. Когда новая система стабильно показывает результаты не хуже старой, трафик постепенно переключается: сначала 5%, затем 20%, 50% и так далее до полного перехода.

Shadow pipeline дал два преимущества. Первое: возможность отката. Если новая модель ошибается на специфическом формате чека, трафик мгновенно возвращается к старой системе. Второе: накопление реальных данных для сравнения. Вместо синтетических тестов команда видела поведение новой системы на живом трафике, что снизило неопределённость при финальном переключении.

Результаты миграции: цифры и факты

Проект завершили за 8 месяцев вместо запланированных 12. Ускорение на треть стало следствием двух факторов: правильного выбора инструментов и экспертной поддержки Hugging Face Expert Acceleration Program, которая сократила время на освоение технологий.

Ключевые метрики:

  • Время разработки сократилось на 30%.
  • Задержка обработки снизилась на 50% благодаря AWS Inferentia.
  • Обучение моделей ускорилось с дней до часов.
  • Полный контроль над AI-инфраструктурой: от данных до моделей и инференса.

Цифры показывают прямую выгоду от владения ML-стеком. Сокращение задержки на 50% при 11 миллионах чеков ежедневно - это миллионы сэкономленных секунд пользовательского ожидания. Обучение за часы вместо дней позволяет быстрее адаптироваться к новым форматам чеков и требованиям бизнес-партнёров. Оценку выгоды от open-source моделей с конкретными цифрами затрат можно найти в разборе кейса Databricks, где открытая модель показала сопоставимое качество при затратах в 4 раза ниже проприетарной.

Уроки и лучшие практики для вашей миграции

Первый урок: контроль над данными и моделями - это стратегический актив. Fetch Rewards смогла предоставить бизнес-партнёрам гранулярную аналитику только после того, как получила доступ к внутренним представлениям модели. Сторонние сервисы редко дают такой уровень прозрачности.

Второй урок: экспертная поддержка ускоряет миграцию. Hugging Face Expert Acceleration Program сократила время освоения технологий и помогла избежать типичных ошибок при первом построении ML-пайплайна. Для команд без глубокого опыта в MLOps такая поддержка может быть решающим фактором между успехом и затянувшимся проектом.

Третий урок: shadow pipeline обязателен для миграции высоконагруженных систем. Параллельный прогон данных и постепенное переключение трафика снижают риски до приемлемого уровня. Это стандартная практика для продакшена, где простой недопустим.

Четвёртый урок: выбор инструментов под задачу. SageMaker для оркестрации, Hugging Face Transformers для моделей, Inferentia для ускорения - каждый компонент решает конкретную проблему. Сборка собственного стека из проверенных open-source и облачных решений оказалась быстрее и дешевле, чем разработка с нуля или продолжение работы с чёрным ящиком. О пяти факторах успеха в ML-проектах, включая выбор проекта и команды, можно прочитать в материале с уроками за 8 лет в ML.

Ограничения и потенциальные риски

Открытые материалы по кейсу Fetch Rewards не раскрывают конкретные архитектуры моделей и детальные метрики точности распознавания. Это ограничивает возможность прямого воспроизведения решения, но не отменяет ценность общих принципов: контроль над данными, shadow pipeline, выбор специализированного железа.

Потенциальные риски при подобной миграции:

  • Необходимость компетенций в ML-инженерии. Собственный пайплайн требует команды, которая умеет обучать, деплоить и мониторить модели. Без этого проект рискует затянуться.
  • Затраты на инфраструктуру. Облачные ресурсы для обучения и инференса стоят денег, и при неправильной оптимизации расходы могут превысить стоимость стороннего сервиса.
  • Сложность поддержки. Собственный ML-стек требует постоянного обновления моделей, мониторинга дрейфа данных и реагирования на инциденты. Это операционная нагрузка, которой нет при использовании внешнего API.

Для команд, которые оценивают переход на собственные модели, важно честно посчитать совокупную стоимость владения: инфраструктура, зарплаты, время на поддержку. Если объём данных и требования к кастомизации невелики, сторонний сервис может оставаться более прагматичным выбором. Кейс Fetch Rewards показывает, что при масштабе в 11 миллионов чеков ежедневно и потребности в гранулярной аналитике собственный пайплайн окупается.

Подписаться на канал