Перейти к содержанию
Публикация AiManual

Какие LLM точнее оценивают калорийность блюд по фотографии: разбор теста на 25 блюдах в 2026 году

Почему крупная LLM может ошибаться в подсчёте калорий по фото? Разбираем тест на 25 блюдах, метрики ошибки до 20%, среднего смещения и медианы, роль USDA FoodDa

Коротко

Что будет в материале

  1. 01

    Какие LLM точнее оценивают калорийность по фотографии

  2. 02

    Как был устроен эксперимент с оценкой калорийности еды по фото

  3. 03

    Что означают метрики точности: ошибка до 20%, смещение и медиана

  4. 04

    Почему размер модели не гарантирует лучшую оценку калорий

Короткий ответ: по переданным материалам нельзя определить, какая LLM стала лидером по оценке калорийности блюд. В описании эксперимента нет названий моделей, значений доли оценок с ошибкой до 20%, среднего смещения и медианной ошибки. Любой рейтинг с конкретными моделями и числами здесь был бы выдумкой.

Из доступной фактуры подтверждается другое: сравнение проводили на 25 случайных блюдах, моделям передавали фотографии и текстовые описания, а для справки использовали USDA FoodData Central и MEXT. Такая выборка помогает увидеть отдельные различия между мультимодальными LLM, но не превращает тест в полноценный научный бенчмарк. Фотография сама по себе редко раскрывает точную массу порции, скрытые ингредиенты, количество масла и способ приготовления.

Ниже разделены два уровня информации: факты об описанном дизайне теста и выводы, которые можно сделать о самой задаче. Фактические лидеры по метрикам требуют полного первоисточника с таблицей результатов.

Какие LLM точнее оценивают калорийность по фотографии

Ответ зависит от конкретных чисел теста, которых в переданных материалах нет. Нельзя назвать победителя по доле оценок с ошибкой до 20%, по среднему смещению или по медианной ошибке. Эти показатели измеряют разные стороны качества, поэтому одна и та же модель могла бы занять первое место по одной метрике и уступить по другой.

Сводная таблица результатов теста

Таблица фиксирует границы доступных данных. В ней нет предположительных оценок и названий моделей, которых нет в описании эксперимента.

МодельДоля оценок с ошибкой до 20%Среднее смещениеМедианная ошибкаВнешняя база
Названия моделей не переданыНет данныхНет данныхНет данныхДля эксперимента упомянуты USDA FoodData Central и MEXT, доступ каждой модели не уточнён

Подтверждённый размер выборки составляет 25 блюд. При 25 наблюдениях одно блюдо соответствует 4 процентным пунктам в доле успешных оценок. Разница в несколько пунктов может возникнуть из-за одного или двух случайных примеров, особенно если блюда сильно отличаются по составу и размеру порций.

Главный вывод без преувеличений

Описанный тест может показать, как модели повели себя на конкретных фотографиях и описаниях. Он не доказывает, что одна LLM лучше всех оценивает калорийность еды в любых условиях.

Даже подтверждённое лидерство в небольшой выборке нужно формулировать аккуратно: конкретная модель показала лучший результат по конкретной метрике на этих 25 блюдах. Переносить такой результат на домашние фотографии, ресторанные блюда, разные кухни и другие размеры порций без дополнительной проверки нельзя.

Проблема сопоставимости знакома и по обычным текстовым бенчмаркам: версия модели, формат запроса, способ подсчёта и настройки запуска способны изменить порядок участников. Практический разбор таких расхождений есть в материале о сравнении моделей, версиях и условиях запуска: почему результаты LLM-тестов могут расходиться.

Как был устроен эксперимент с оценкой калорийности еды по фото

В задаче сошлись четыре компонента: изображение, текстовое описание, справочная пищевая ценность и способ расчёта ошибки. Итоговая цифра зависит от всей цепочки. Модель может правильно узнать блюдо, но неверно оценить его массу; может угадать порцию, но выбрать неподходящий вариант продукта в базе.

Выборка из 25 случайных блюд

Выборка из 25 случайных блюд подходит для предварительного наблюдения, однако чувствительна к случайному составу. Если в наборе много простых блюд с хорошо видимыми ингредиентами, модели получают более лёгкую задачу. Если преобладают супы, салаты с соусом, выпечка, блюда с начинкой или еда в непрозрачной упаковке, неопределённость резко возрастает.

Случайная выборка не гарантирует представительство разных кухонь, способов приготовления, типов посуды, освещения и ракурсов. Она не отвечает на вопрос, как AI-счётчик справится с блюдами, которые пользователь фотографирует каждый день.

При 25 блюдах отдельная ошибка сильно влияет на итог. Один провальный пример меняет долю оценок в нужном диапазоне на 4 процентных пункта. Среднее смещение тоже может заметно измениться из-за одной особенно большой порции или блюда с большим количеством скрытого масла.

Какие данные получали модели: фото и описание блюда

Из доступного описания следует, что модели получали фотографию еды и её текстовое описание. Такая постановка уже отличается от задачи распознавания изображения без контекста: текст может уточнить название блюда, ингредиенты или размер порции.

При этом не раскрыты важные детали методики: были ли промпты полностью одинаковыми, сообщали ли моделям фактический вес, имели ли они доступ к инструментам поиска по базам, сколько попыток делала каждая модель и как обрабатывались ответы в свободной форме. Без этих данных трудно отделить качество самой LLM от влияния промпта и дополнительных инструментов.

Текстовое описание способно как уменьшить неопределённость, так и создать ложную точность. Фраза «паста с курицей» не сообщает массу макарон, количество сливочного соуса и объём масла. Формулировка «большая тарелка пасты» остаётся субъективной, если рядом нет весов или предмета с известным размером.

Как использовались USDA FoodData Central и MEXT

USDA FoodData Central и MEXT в описании теста выступают как справочные источники пищевой ценности. Они могут помочь сопоставить распознанный продукт с записью, где указаны калории и содержание белков, жиров и углеводов.

Справочная база не устраняет неопределённость на предыдущих этапах. Для расчёта нужны как минимум название продукта, масса и подходящая форма обработки. Запись для варёного риса не равна записи для сухого риса, а значение для куриной грудки без кожи не описывает блюдо с панировкой и маслом.

Неясно, обращалась ли каждая модель к USDA FoodData Central и MEXT напрямую или базы использовали после генерации ответов для проверки. Это принципиальная разница. В первом случае сравнивается связка LLM и внешних данных, во втором в большей степени оценивается способность модели распознать блюдо и выдать правдоподобную оценку.

Для воспроизводимости автору теста нужно показать исходные фотографии, описания, промпты, правила сопоставления продуктов, эталонные значения и полные ответы моделей. Без такой документации число в итоговой таблице трудно проверить.

Что означают метрики точности: ошибка до 20%, смещение и медиана

Три метрики отвечают на разные вопросы. Доля в пределах 20% показывает практическую приемлемость, среднее смещение раскрывает направление ошибки, медианная ошибка описывает типичный масштаб отклонения. Использовать одну цифру как универсальный рейтинг некорректно.

Доля оценок с ошибкой до 20%

Метрика показывает, какая часть предсказаний попала в диапазон, ограниченный 20% от эталонной калорийности. Если эталон блюда равен 600 ккал, оценка 500 ккал отличается примерно на 16,7% и попадает в этот диапазон. Оценка 720 ккал отличается ровно на 20%, если граница включается в расчёт. Значение 780 ккал даёт ошибку 30% и не проходит порог.

Формула обычно выглядит так: abs(оценка - эталон) / эталон <= 0,20. Но в исходном описании не указано, использовали ли именно абсолютную относительную ошибку и включали ли значение ровно 20%.

Метрика удобна для бытового сценария, когда нужно понять, насколько часто модель даёт приблизительно приемлемый ответ. Она скрывает размер провалов за пределами порога. Модель с несколькими оценками на 21% и одной на 150% может получить такую же долю успешных случаев, как модель с ошибками около 40%, если число попаданий совпадёт.

Среднее смещение: модель завышает или занижает калорийность

Смещение показывает направление ошибки. В простом варианте его считают как среднее значение разности оценка модели - эталон. Положительное число означает систематическое завышение, отрицательное - занижение.

Для регулярного контроля рациона направление имеет практический смысл. Постоянное занижение может создавать у пользователя иллюзию дефицита калорий, а завышение делает оценку более консервативной, но тоже искажает сравнение блюд.

Единица измерения должна быть указана в отчёте: это могут быть ккал, проценты или относительная ошибка. В переданных материалах формула и единица среднего смещения не приведены.

Нулевое среднее не означает точность. Две ошибки, например плюс 200 ккал и минус 200 ккал, взаимно компенсируются. Средний результат даст ноль, хотя обе отдельные оценки далеки от эталона.

Медианная ошибка показывает типичный результат

Медиана помогает увидеть центральное наблюдение после сортировки ошибок. Если для каждого из 25 блюд посчитана одна абсолютная ошибка и пропусков нет, медианой станет значение на 13-й позиции в упорядоченном списке.

Медианная ошибка меньше зависит от единичного выброса, чем средняя абсолютная ошибка. Она отвечает на вопрос: насколько модель ошибается в типичном случае. При этом медиана не показывает направление, поэтому её нужно читать рядом со средним смещением.

Нельзя смешивать медианную абсолютную ошибку, медианную относительную ошибку и медиану подписанных отклонений. У этих показателей разный смысл. Полный отчёт должен явно указать формулу, единицы и способ обработки пропущенных ответов.

Похожая логика действует при оценке уверенности LLM: заявленная моделью уверенность и фактическая надёжность могут расходиться. Методики измерения такой неопределённости разобраны в статье о сравнении методов оценки уверенности LLM. Для AI-счётчика калорий полезно применять тот же принцип: уверенный тон ответа не заменяет проверяемую метрику.

Почему размер модели не гарантирует лучшую оценку калорий

Оценка калорийности по фотографии состоит из нескольких задач. LLM должна распознать продукты, определить вероятный рецепт, оценить размер порции, выбрать сопоставимую запись в справочной базе и сложить вклад ингредиентов. Большое число параметров может помочь на отдельных этапах, но само по себе не сообщает модели массу еды на снимке.

Распознавание изображения и оценка размера порции

Фото не содержит встроенных весов. Один и тот же кусок мяса может занимать одинаковую площадь кадра при разной толщине, а расстояние до камеры меняет видимый размер порции.

На результат влияют ракурс, фокус, освещение, тени, цвет тарелки и перекрытие ингредиентов. Листья салата могут закрывать сыр, соус прячется под макаронами, а масло на поверхности блюда почти невозможно оценить по блеску. Посуда иногда помогает получить приблизительный масштаб, но стандартный размер тарелки нельзя считать известным без дополнительных данных.

Сильная текстовая модель может подробно объяснить, почему в блюде много калорий, однако объяснение не добавляет точности к неизвестной массе. Задача требует визуального вывода с высокой неопределённостью.

Задача требует не только распознать блюдо

После определения названия начинается расчётная часть:

  1. выделить видимые и вероятные ингредиенты;
  2. оценить массу каждого компонента;
  3. восстановить рецепт и способ приготовления;
  4. подобрать сопоставимый продукт в справочной базе;
  5. посчитать вклад каждого ингредиента и сложить значения.

При известной массе базовая схема выглядит так: ккал блюда = сумма(масса ингредиента в граммах * ккал на 100 г / 100). Ошибка в массе на первом этапе переносится в финальный результат. Ошибка в рецепте добавляет или убирает масло, сахар, сливки, сыр, панировку и другие компоненты.

Название блюда задаёт категорию, но не фиксирует рецептуру. Два блюда с названием «картофель с курицей» могут иметь разную калорийность из-за количества масла, кожи, соуса и воды после приготовления.

Влияние внешних данных, промпта и конкретного сценария

Результат зависит от того, какие действия разрешены модели. Один сценарий требует назвать продукт и приблизительную калорийность по памяти. Другой даёт доступ к USDA FoodData Central и MEXT, просит выбрать запись и вывести расчёт по ингредиентам. Эти сценарии нельзя сравнивать как чистое соревнование размеров моделей.

На итог влияют формулировка запроса, требование показывать допущения, формат ответа, лимит времени и число попыток. Модель, которую просят вернуть диапазон и перечислить неизвестные параметры, может выглядеть менее точной по одной точечной метрике, хотя её ответ полезнее для реального пользователя.

Сравнивать мультимодальные LLM корректно при одинаковом изображении, одинаковом описании, одинаковом промпте, равном доступе к внешним данным и одинаковом правиле подсчёта. Иначе таблица измеряет конфигурации, а не способности моделей.

Практический разбор model card и расхождения между оценками на бенчмарке и в рабочем сценарии помогает увидеть эту проблему шире: как читать результаты тестирования LLM.

Где AI-счётчики калорий ошибаются чаще всего

AI-оценка калорийности не измеряет энергию напрямую. Она строит гипотезу по изображению, тексту и справочным значениям. Чем больше неизвестных в исходных данных, тем шире разумный диапазон результата.

Неизвестная масса и размер порции

Главный источник ошибки - масса. На фотографии может быть виден полный объём еды, но не его вес. 150 г варёного риса и 300 г риса на похожих снимках отличаются вдвое по калорийности, если остальные условия одинаковы.

Для смешанных блюд визуальная оценка ещё сложнее. В супе жидкость распределяется между ингредиентами, в салате листья занимают большой объём при небольшой массе, а плотная начинка может оставаться под тестом. Модель вынуждена подставлять типичные значения, а не считывать фактическое количество.

Скрытые ингредиенты и состав рецепта

Основной продукт часто виден лучше, чем добавки. Масло для жарки, майонез, сыр, сахар, сливки, орехи и сладкие сиропы могут существенно изменить ккал и КБЖУ. Небольшая порция соуса способна добавить больше энергии, чем визуально заметный гарнир.

Модель может распознать «салат с курицей», но не узнать, сколько в нём заправки. Слово «домашний» тоже не раскрывает состав. Для расчёта нужны рецепт, список ингредиентов и их масса.

Способ приготовления и потери влаги

Варка, запекание, жарка и приготовление во фритюре дают разные результаты при одинаковом наборе продуктов. Масло добавляет энергию, панировка увеличивает массу сухих компонентов, маринад меняет состав поверхности, а вода меняет вес и концентрацию калорий на 100 г.

После варки продукт может стать тяжелее из-за воды, после запекания - легче из-за её потери. Сама фотография обычно не показывает, сколько влаги ушло и сколько жира впиталось. Поэтому корректный расчёт требует знать способ приготовления и хотя бы приблизительный состав рецепта.

Одна фотография не раскрывает всю структуру блюда

Многослойные, фаршированные и смешанные блюда содержат компоненты, которые камера не видит. В сэндвиче часть соуса и сыра закрыта хлебом, в пироге начинка скрыта тестом, а в рагу ингредиенты перемешаны.

Один ракурс не позволяет надёжно проверить все предположения. Дополнительные фотографии сверху и сбоку могут помочь оценить объём, но не заменяют взвешивание. Уверенный стиль ответа модели не повышает достоверность исходных данных.

Как использовать ИИ для подсчёта калорий по фотографии на практике

Фотоаналитика приносит пользу, когда сокращает ручной ввод и помогает быстро получить ориентир. Качество результата растёт вместе с количеством известных параметров: масса, ингредиенты, способ приготовления и состав добавок.

Как повысить качество входных данных

Перед отправкой фотографии полезно добавить в запрос:

  • название блюда и полный список известных ингредиентов;
  • вес всей порции или отдельных компонентов;
  • способ приготовления: варка, жарка, запекание, фритюр;
  • количество масла, соуса, сахара, сыра и других калорийных добавок;
  • размер посуды или предмет для приблизительного масштаба;
  • просьбу перечислить допущения и показать диапазон, если данных недостаточно.

Фотографию лучше делать при равномерном освещении, показывать блюдо целиком и не закрывать часть тарелки столовыми приборами. Для объёмных блюд полезны два ракурса. Это уменьшает неопределённость формы, но не даёт точной массы без весов.

Рабочий шаблон запроса может выглядеть так:

Проанализируй блюдо на фотографии. Используй описание: [блюдо и ингредиенты].
Вес порции: [граммы или неизвестно]. Способ приготовления: [описание].
Отдельно перечисли видимые ингредиенты, неизвестные параметры и допущения.
Дай оценку ккал и КБЖУ диапазоном, а не одной точкой.
Не подменяй неизвестную массу типичным значением без явной пометки.

Такой формат не делает расчёт точным автоматически. Он помогает отличить данные пользователя от предположений модели и облегчает последующую проверку.

Когда приблизительной оценки достаточно

Приблизительная оценка подходит для быстрой фиксации приёмов пищи, грубого сравнения похожих блюд и контроля общей структуры рациона. Пользователь может увидеть, что плотный сливочный соус заметно меняет итог, а большая порция гарнира требует отдельного учёта.

В этом сценарии ценность AI-счётчика связана со снижением ручного ввода. Ошибка в несколько десятков процентов может быть приемлемой для наблюдения за тенденцией, если пользователь понимает её масштаб и не принимает число за измерение.

Когда нужны весы, этикетка или точный рецепт

Для строгого контроля калорийности нужны фактическая масса продуктов, пищевая этикетка или рецепт с рассчитанной пищевой ценностью. Весы дают параметр, которого нет на обычной фотографии. Этикетка помогает для упакованных продуктов, а рецепт позволяет учесть масло, соусы и изменение массы после приготовления.

Если ошибка в рационе критична для конкретной цели, на оценку по одному снимку полагаться нельзя. AI может помочь разобрать состав или подготовить черновой расчёт, но итог нужно сверять с измеряемыми данными и при необходимости с профильным специалистом.

Как выбирать модель под задачу, а не по размеру

При выборе мультимодальной LLM полезно проверить пять параметров:

  • качество распознавания именно тех фотографий и блюд, которые встречаются в вашем сценарии;
  • способность отделять наблюдаемые факты от предположений;
  • умение работать с внешней справочной базой и приводить использованные записи;
  • поддержку структурированного ответа с ингредиентами, массой, ккал и КБЖУ;
  • стоимость, скорость, приватность изображений и удобство подключения к рабочему процессу.

Для локальной модели нужно отдельно учитывать доступную видеопамять и качество мультимодального адаптера. Для облачного API важны лимиты на изображения и правила хранения данных. Большая текстовая модель без подходящего анализа изображений может проиграть компактной системе, настроенной под конкретный тип фото.

Итог: что показывает тест и чего он не доказывает

Краткий ответ для пользователя

Фактического лидера по тесту назвать нельзя: в переданных материалах отсутствуют названия LLM и числовые результаты. Подтверждено лишь, что сравнение охватывало 25 случайных блюд, фотографии с описаниями и использование USDA FoodData Central и MEXT для справки.

Если полный отчёт содержит таблицу, модели нужно сравнивать отдельно по трём категориям. Доля ошибок до 20% отвечает за частоту приемлемых оценок. Среднее смещение показывает, завышает или занижает модель. Медианная ошибка показывает типичный масштаб отклонения. Победитель по одной категории не получает автоматическое лидерство по двум другим.

Для повседневного подсчёта AI подходит как ориентир, особенно когда пользователь добавляет вес, состав и способ приготовления. Без этих параметров результат остаётся оценкой по неполному наблюдению.

Граница применимости результатов

25 случайных блюд недостаточно для полноценного научного бенчмарка. Такой тест не устанавливает универсальное превосходство одной модели и не описывает точность на всех типах еды, кухнях, порциях и условиях съёмки.

Более строгий эксперимент должен включать большую и разнообразную контрольную выборку, известный вес готовых блюд, зафиксированные рецепты, единые фотографии и одинаковые промпты. Для каждого блюда полезно делать несколько снимков, заранее описывать правила выбора продуктов в базе и сохранять полный ответ модели.

Отчёт должен отдельно показывать абсолютную и относительную ошибку, среднее смещение, медианную ошибку, выбросы и интервалы неопределённости. Повторный прогон позволит понять, насколько стабилен результат при одинаковом входе. Такой дизайн даст основания для более содержательного сравнения, хотя и он не превратит фото в лабораторный прибор.

Практический вывод простой: выбирайте модель под конкретный сценарий и проверяйте её на собственных фотографиях. Используйте оценку AI для скорости и ориентирования, а весы, этикетку и точный рецепт оставляйте источниками данных для случаев, где ккал и КБЖУ нужно считать строго.

Подписаться на канал