Что произошло: Kakao Brain и Hugging Face открывают модели и датасет
Kakao Brain совместно с Hugging Face выпустили открытые версии моделей ViT и ALIGN, обученные на датасете COYO-700M. Датасет содержит 700 миллионов пар изображение-текст. Это первый случай, когда модель ALIGN стала доступна с открытым исходным кодом и публичным тренировочным датасетом. Оригинальные модели Google обучались на закрытых данных, что мешало воспроизводимости и развитию. Теперь это ограничение устранено.
Модели доступны на Hugging Face Hub. Их можно загрузить через библиотеку Transformers и использовать для классификации изображений, zero-shot поиска изображений по тексту и построения мультимодальных систем. Релиз важен для исследователей и разработчиков, которым нужны мощные предобученные модели без зависимости от закрытых API.
Открытые веса и данные меняют правила игры. Команды, которые раньше не могли позволить себе обучение на гигантских закрытых датасетах, получают готовую основу для экспериментов. Это шаг к демократизации AI, о котором мы писали в разборе тренда на открытые модели: почему проприетарные AI-модели США уступают открытым альтернативам.
COYO-700M: новый открытый датасет из 700 миллионов пар изображение-текст
COYO-700M собран из общедоступных веб-страниц. Каждая запись содержит изображение, текстовую подпись и метаданные: alt-тексты, заголовки, контекст страницы. Объём в 700 миллионов пар сопоставим с масштабом закрытых датасетов Google, таких как JFT-300M и WebLI. Разница в том, что COYO-700M можно свободно скачать и использовать.
Датасет очищен от персональных данных и низкокачественного контента. Фильтрация включает удаление дубликатов, проверку разрешения изображений и отсев текстов с высокой долей шума. Это снижает барьер входа для команд, которые хотят обучать мультимодальные модели на том же масштабе данных, что и крупные корпорации.
Почему открытость датасета - это прорыв
Оригинальные модели Google обучались на закрытых данных. Исследователи не могли проверить результаты, воспроизвести обучение или дообучить модель на тех же данных. Открытый COYO-700M решает эту проблему. Теперь можно воспроизводить результаты Kakao Brain, дообучать модели под свои задачи и создавать новые архитектуры на том же масштабе.
Открытость данных ускоряет исследования. Вместо месяцев на сбор и очистку собственного датасета команда может сразу начать эксперименты. Для стартапов и академических групп это экономия ресурсов и времени. Прозрачность данных также позволяет аудировать модели на предвзятости и ошибки, что важно для ответственного внедрения AI.
Архитектура открытых моделей: ViT и ALIGN
Обе модели повторяют оригинальные архитектуры, но обучены на открытых данных COYO-700M. Это принципиальное отличие: веса получены без использования закрытых датасетов Google. Разберём каждую архитектуру.
Vision Transformer (ViT): как изображение становится последовательностью токенов
ViT переносит архитектуру Transformer из NLP в компьютерное зрение. Изображение делится на патчи размером 16x16 пикселей. Каждый патч линейно проецируется в эмбеддинг. К последовательности эмбеддингов добавляются позиционные эмбеддинги, после чего она подаётся в стандартный Transformer encoder.
Предобучение ViT выполняется на большом датасете изображений с учителем. После этого модель файнтюнится на downstream задачах: классификация, детекция, сегментация. Открытая версия от Kakao Brain обучена на COYO-700M, что делает её воспроизводимой альтернативой оригинальному ViT от Google, обученному на JFT-300M.
ALIGN: двухэнкодерная модель для сопоставления изображений и текста
ALIGN использует два отдельных энкодера: image encoder для изображений и text encoder для текста. Оба энкодера проецируют входные данные в общее эмбеддинговое пространство. Обучение выполняется с контрастивной функцией потерь InfoNCE на парах изображение-текст: модель учится максимизировать сходство между эмбеддингами соответствующих пар и минимизировать для несоответствующих.
После обучения ALIGN выполняет zero-shot задачи без дополнительного обучения. Классификация изображения сводится к сравнению его эмбеддинга с эмбеддингами текстовых меток. Поиск изображений по тексту работает аналогично: вычисляется сходство между текстовым запросом и всеми изображениями в базе. Это делает ALIGN универсальным инструментом для мультимодального поиска.
Сравнение производительности с оригинальными моделями Google
Открытые модели показывают результаты, сопоставимые с оригинальными версиями Google. Разница в производительности объясняется датасетом предобучения: COYO-700M против закрытых JFT-300M и WebLI. Небольшое отставание компенсируется открытостью и возможностью дообучения.
Результаты на ImageNet: классификация изображений
Для ViT-B/16, обученного на COYO-700M, top-1 accuracy на ImageNet находится в пределах нескольких процентных пунктов от оригинального ViT, обученного на JFT-300M. Точные цифры зависят от конфигурации и процедуры файнтюнинга. Для практических задач разница незначительна, если учесть, что открытую модель можно дообучить на своих данных.
Результаты на MS-COCO: zero-shot поиск изображений по тексту
ALIGN на COYO-700M показывает конкурентоспособные метрики recall@k на задачах text-to-image и image-to-text retrieval на MS-COCO. Открытая модель уступает оригинальной ALIGN от Google в пределах допустимого, но превосходит её по доступности: оригинальные веса Google не были публичными. Для команд, которым нужен zero-shot retrieval без закрытых API, это рабочий вариант.
Сравнение открытых и закрытых моделей мы подробно разбирали в статье о скрытом влиянии проприетарных AI: могут ли закрытые AI-модели манипулировать общественным мнением.
Практическое использование: код с библиотекой Transformers
Модели доступны в библиотеке Transformers. Установите её, если ещё не сделали этого:
pip install transformers torch pillowКлассификация изображений с ViT
Загрузка предобученной модели ViT и классификация изображения:
from transformers import ViTForImageClassification, ViTImageProcessor
from PIL import Image
import requests
model = ViTForImageClassification.from_pretrained("kakaobrain/vit-base-patch16-coyo")
processor = ViTImageProcessor.from_pretrained("kakaobrain/vit-base-patch16-coyo")
image = Image.open("example.jpg")
inputs = processor(images=image, return_tensors="pt")
outputs = model(**inputs)
predicted_class = outputs.logits.argmax(-1).item()
print(f"Predicted class: {predicted_class}")Zero-shot классификация и поиск изображений с ALIGN
ALIGN позволяет сравнивать эмбеддинги изображений и текстов. Пример zero-shot классификации:
from transformers import AlignProcessor, AlignModel
from PIL import Image
import torch
model = AlignModel.from_pretrained("kakaobrain/align-base-coyo")
processor = AlignProcessor.from_pretrained("kakaobrain/align-base-coyo")
image = Image.open("example.jpg")
text_labels = ["a photo of a cat", "a photo of a dog", "a photo of a car"]
inputs = processor(text=text_labels, images=image, return_tensors="pt", padding=True)
outputs = model(**inputs)
logits_per_image = outputs.logits_per_image
probs = logits_per_image.softmax(dim=1)
print(f"Probabilities: {probs}")Для поиска изображений по тексту вычислите эмбеддинги текстового запроса и всех изображений в базе, затем найдите ближайшие по косинусному сходству. Этот подход работает без дообучения и подходит для построения мультимодальных поисковых систем.
Значение релиза для индустрии и open-source сообщества
Открытые ViT и ALIGN на COYO-700M снижают барьер входа в мультимодальные исследования. Малые команды и индивидуальные разработчики получают доступ к моделям, которые раньше требовали ресурсов крупных корпораций. Воспроизводимость результатов позволяет проверять заявления производителей и строить на их основе новые архитектуры.
Релиз продолжает тренд на открытые веса, который мы анализировали в статье о поддержке open-weight моделей технологическими гигантами. Открытые данные в сочетании с открытыми весами создают полный цикл воспроизводимости: от сырых данных до готовой модели. Это ускоряет инновации в мультимодальных системах, включая поиск, генерацию описаний и визуальные вопросно-ответные системы.
Для бизнеса открытые модели означают снижение затрат на инференс и отсутствие привязки к облачным API. Локальный запуск ViT и ALIGN возможен на стандартном оборудовании, что экономит до 80% бюджета по сравнению с закрытыми сервисами. Подробнее об экономике открытых моделей: тренд на лояльные AI-модели: почему отказываются от подписок OpenAI и Anthropic.
Ограничения и потенциальные проблемы
COYO-700M собран из веб-страниц, поэтому датасет содержит шум: ошибки в подписях, нерелевантные пары изображение-текст, возможные предвзятости. Фильтрация снижает эти проблемы, но не устраняет полностью. Перед использованием в продакшене проверьте качество данных на своих задачах.
Лицензионные аспекты требуют внимания. Датасет открыт, но изображения могут иметь собственные права. Для коммерческого использования проверьте лицензии исходных источников. Модели распространяются с открытыми весами, но условия использования могут отличаться в зависимости от юрисдикции.
Производительность открытых моделей немного ниже оригиналов Google из-за датасета предобучения. Для задач, где критичны доли процента точности, стоит провести дообучение на целевых данных. Для большинства прикладных сценариев разница незначительна.
Заключение: что это значит для вас
Открытые ViT и ALIGN на COYO-700M дают вам готовые инструменты для классификации изображений, zero-shot поиска и мультимодальных систем. Модели загружаются через Transformers, работают без дообучения для базовых задач и легко адаптируются под специфические данные. Датасет COYO-700M открывает путь к воспроизводимым экспериментам и собственному обучению моделей на масштабе 700 миллионов пар.
Попробуйте модели на своих данных. Начните с zero-shot классификации на ALIGN, сравните с ViT на задаче классификации. Если нужна более глубокая интеграция, используйте COYO-700M для дообучения. Открытость этого релиза - практический ресурс для ваших проектов, а не только новость. Развитие открытых мультимодальных моделей продолжается, и мы следим за ним в наших обзорах: эволюция спектра возможностей нейросетей.