find-everything - Windows-приложение для поиска по содержимому файлов. Оно ищет не по совпадению с названием файла, а по тому, что находится внутри изображения, видео, документа или аудиозаписи.
По заявленному сценарию запрос «Кошка» может найти фотографию с кошкой, ролик и секунду её появления, документ с нужным словом и аудиозапись, где это слово произнесено. Вычисления заявлены как локальные: пользовательские файлы не должны отправляться на сервер.
Такой подход полезен для архивов, где названия вроде IMG_4821.jpg, meeting-final-2.mp4 или Документ новый.docx давно перестали что-либо объяснять. Интерфейс find-everything доступен на русском и английском языках.
Что такое find-everything и кому нужен поиск по содержимому файлов AI
find-everything рассчитан на Windows и объединяет несколько видов локального поиска: визуальный поиск по фото и видео, поиск слов в документах и поиск речи в аудиозаписях. Приложение пытается сопоставить текстовый запрос с содержимым файла, а не с его именем или папкой хранения.
Инструмент может пригодиться владельцу локальной медиатеки, рабочего архива документов, коллекции записей встреч или домашнего AI-сервера. Его практический смысл в том, чтобы сократить ручной просмотр файлов, когда нужный объект, реплика или фрагмент находятся внутри материала.
Когда обычного поиска по имени файла уже недостаточно
Обычный поиск хорошо работает, если файл назван дисциплинированно и пользователь помнит часть имени. На практике это условие часто не выполняется. Фото может содержать нужный объект, но называться по дате съёмки. Видеоролик может включать искомый эпизод на одной секунде из десятков минут. Документ хранит термин в тексте, а запись встречи - произнесённую фразу.
Во всех этих случаях запрос относится к содержимому. Поиск по имени файла не может найти кошку на фотографии, момент её появления в видео или слово, которое было сказано вслух.
Какие данные приложение обрабатывает локально
В описании find-everything подтверждены четыре категории контента: изображения, видео, документы и аудиозаписи. Для каждого типа заявлен свой результат: объект на изображении, момент в ролике, фрагмент документа или распознанное слово в записи.
Полный перечень поддерживаемых расширений и контейнеров в доступном описании не указан. Поэтому не стоит заранее считать, что приложение обработает любой файл из архива без проверки на реальных данных.
Локальный поиск по изображениям и видео: объект на фото и момент в ролике
Визуальная часть find-everything предназначена для текстовых запросов к изображению и видеоматериалам. Для локального анализа изображений заявлены модели CLIP и OWLv2.
Поиск объекта на изображении
CLIP используется для анализа изображений, а OWLv2 - для поиска объектов на них. В заявленном примере запрос «Кошка» должен привести к фотографии, где кошка действительно присутствует, даже когда слово отсутствует в имени файла.
Для изображения заявлен показ силуэта найденного объекта. Это помогает быстро понять, почему файл попал в выдачу, и не открывать подряд все похожие результаты. Качество такого поиска, точность локализации и поведение на сложных кадрах в описании не раскрыты.
Для задач компьютерного зрения в офлайн-среде полезен обзор локальных моделей для STT, аудио и vision. Он даёт более широкий контекст по моделям, которые работают без облачной обработки.
Поиск нужного момента внутри видео
Для видео find-everything заявляет поиск ролика и секунды, на которой появляется объект. Вместо ручной перемотки каждого файла пользователь получает точку входа в нужный фрагмент.
В описании упомянуты быстрый просмотр прямо в проводнике и собственный проигрыватель. Эти функции нужны для проверки результата на месте. Поддерживаемые кодеки, контейнеры, длительность роликов и скорость обработки не подтверждены, поэтому оценивать инструмент лучше на небольшой копии собственной видеотеки.
Поиск внутри документов и аудиозаписей
find-everything заявлен и для текстовых данных: он может найти слово в документе и произнесённое слово в аудиозаписи. Это разные пайплайны, хотя пользовательский запрос выглядит одинаково.
Поиск слова в документе и несколько мест совпадения
Для документов заявлена выдача до девяти мест совпадения сразу, каждое с отдельным фрагментом текста. Такой формат удобен, когда термин встречается в нескольких частях файла и нужно быстро выбрать релевантный контекст.
В исходном описании упоминается поиск слов с учётом склонений. Полный список языков, типов документов и правила обработки сложных формулировок не опубликованы. Для сканов и документов со сложной вёрсткой отдельной задачей остаётся OCR: её методы и ограничения разобраны в материале об открытых OCR-моделях 2026 года.
Поиск произнесенного слова в аудио через Whisper
Для аудиозаписей приложение использует Whisper. Модель распознаёт речь, преобразует её в текст, после чего по тексту можно искать произнесённые слова.
Практический сценарий понятен: в наборе заметок или записей встреч требуется найти момент, где прозвучал конкретный термин. find-everything заявляет показ найденного слова, но доступные материалы не содержат данных о языках, качестве транскрибации, работе с шумом и точности временных меток.
Как устроен локальный AI-поиск в find-everything
В технической основе find-everything указаны CLIP, OWLv2 и Whisper. Модели запускаются через ONNX Runtime с DirectML, а вычисления заявлены как локальные.
CLIP, OWLv2 и Whisper: за что отвечает каждая модель
| Компонент | Заявленная задача |
|---|---|
| CLIP | Локальный анализ изображений |
| OWLv2 | Поиск объектов на изображениях |
| Whisper | Распознавание речи в аудиозаписях |
| ONNX Runtime | Среда запуска моделей |
| DirectML | Использование GPU с поддержкой DX12 |
Эта связка разделяет задачи по типу содержимого. CLIP и OWLv2 отвечают за визуальные сценарии, Whisper - за речь. Внутренние архитектуры моделей, их версии и параметры в доступном описании не указаны.
ONNX Runtime и DirectML: почему заявлена работа на DX12 GPU
ONNX Runtime исполняет модели, а DirectML даёт приложению доступ к графическому ускорению через DirectX 12. Согласно описанию, find-everything может использовать любой DX12 GPU.
Из этого нельзя вывести конкретную скорость на видеокартах NVIDIA, AMD или Intel. Нет подтверждённых требований к VRAM, RAM, загрузке GPU и наличию CPU-режима. Для планирования локальной AI-системы такие параметры нужно проверять отдельно, а не достраивать по названию бэкенда.
Приватность: данные не должны уходить в облако
Разработчик заявляет локальную обработку: CLIP, OWLv2 и Whisper работают на компьютере пользователя, а файлы не загружаются на сервер. Это критично для личных архивов, рабочих документов и записей, которые нельзя передавать во внешние сервисы.
Первоначальная загрузка моделей требует доступа к интернету. Это отдельный процесс и не означает отправку пользовательских файлов. После загрузки нужных моделей постоянное сетевое подключение, согласно описанию, не требуется.
Установка и запуск Windows-приложения для поиска по фото и видео
Для запуска нужны Windows 10 или Windows 11, Python 3.10 или новее и установленный WebView2. В исходном описании указана проверка Python вплоть до версии 3.14, но это не даёт гарантии для всех будущих версий интерпретатора.
Что нужно подготовить: Windows 10/11, Python 3.10+ и WebView2
- Windows 10 или Windows 11;
- Python 3.10 или новее;
- WebView2;
- GPU с поддержкой DX12, если ориентироваться на заявленный путь через DirectML.
Описание не содержит команд установки, способа сборки в исполняемый файл и подробного процесса настройки. Поэтому перед запуском следует сверить фактическую инструкцию проекта с состоянием своего ПК.
Когда скачиваются модели и нужен ли интернет после первого поиска
При первом поиске приложение скачивает необходимые модели в локальную папку cache. Заявлено, что загружается только нужный набор, а после этой подготовки интернет не требуется.
Точный путь к cache, размер файлов и объём загрузки не подтверждены. На системном диске стоит заранее оставить свободное место и не прерывать первичную загрузку без необходимости.
Что важно учитывать перед использованием find-everything
find-everything выглядит практичным вариантом для локального поиска по смешанному архиву, но доступное описание раскрывает продукт не полностью. Границы применимости лучше определить до работы с критичными файлами.
Какие характеристики нельзя подтвердить по доступному описанию
- Полный список форматов изображений, видео, документов и аудио.
- Скорость первичной обработки и поиска.
- Требования к оперативной памяти и видеопамяти.
- Точность визуального поиска и распознавания речи.
- Поддерживаемые языки и особенности поиска по склонениям.
- Полный перечень известных ограничений.
Эти пробелы не говорят о проблеме продукта, но не позволяют обещать предсказуемый результат на любом наборе файлов. Для рабочего архива разумно начать с небольшой копии или с не критичных данных, затем проверить релевантность выдачи, потребление ресурсов и удобство просмотра результатов.
Кому инструмент может быть полезен уже по заявленным функциям
Приложение может подойти пользователям Windows с локальными фотоархивами, видеоматериалами, документами и аудиозаписями. Самые понятные сценарии: найти объект на снимке, момент в ролике, термин в документе или слово в записи встречи.
Требование Python и WebView2 делает find-everything скорее инструментом для пользователя, готового один раз подготовить Windows-среду. Для тех, кто строит локальные AI-воркфлоу вокруг документов, полезен и пример локального извлечения данных из документов на устройстве: там разобран другой сценарий, но тот же принцип обработки чувствительных данных без облака.
Главная ценность find-everything в заявленной модели работы: запрос формулируется по содержимому, вычисления выполняются локально, а результаты помогают быстро перейти к нужному файлу или фрагменту. Перед постоянным использованием стоит проверить его на собственном наборе данных и не ожидать неподтверждённых характеристик по скорости, форматам и качеству.