Tether AI представила VisionPsy-Nano для смартфонов — работа без интернета и защита от утечек
Модели VisionPsy-Nano от Tether AI Research доказывают, что смартфон способен анализировать изображения быстрее и точнее, чем облачные сервисы, при этом работая полностью без интернета. Разработчики предлагают выбор между максимальной точностью и мгновенным откликом, что позволяет бизнесу внедрять ИИ-аналитику в приложения без риска утечки данных и зависимости от качества связи.
Лаборатория Tether AI Research представила семейство моделей VisionPsy-Nano, созданных специально для работы на мобильных устройствах без подключения к облаку. Эти модели весом около 460 миллионов параметров демонстрируют лучшие результаты в своем классе, превосходя аналоги по точности и скорости на 16 из 17 тестовых задач. Разработчики предлагают два варианта: VisionPsy-Nano-460M для максимальной точности и VisionPsy-Nano-460M-Flash для мгновенного отклика на смартфоне.
Важный нюанс: Переход на локальные модели смещает фокус с простого уменьшения размера нейросети на оптимизацию обработки визуальных данных. Снижение количества визуальных токенов (единиц изображения) позволяет ускорить работу в разы, не жертвуя качеством понимания сцены.
Два подхода к работе на устройстве
Семейство моделей решает главную проблему мобильных ИИ: необходимость выбирать между качеством ответа и скоростью его получения. Tether AI Research предлагает гибкое решение, разделяя задачи на два типа.
- VisionPsy-Nano-460M: Оптимизирован для точности. Этот вариант подходит для сложных задач, где важна детализация, например, анализ документов, чтение графиков или решение логических задач. Он лидирует в категориях понимания текста, визуального восприятия и рассуждений.
- VisionPsy-Nano-460M-Flash: Создан для скорости. Модель использует меньше визуальных токенов, что позволяет сократить время до появления первого слова ответа. На устройствах iPhone 15 и Galaxy S25 Ultra она работает в 19–36 раз быстрее аналогов при сохранении 99% качества исходной модели.
Оба варианта работают в режиме одного изображения на запрос, что позволяет концентрировать вычислительные ресурсы на глубоком анализе конкретной сцены, а не на обработке потоков данных.
Производительность и сравнение с конкурентами
Тестирование проводилось на реальном оборудовании, включая Pixel 9, Galaxy S23, Galaxy S25 Ultra и iPhone 15. Результаты показывают, что компактная архитектура может конкурировать с моделями, в два раза превышающими её по размеру.
| Характеристика | VisionPsy-Nano-460M | VisionPsy-Nano-460M-Flash | Конкуренты (0.75–1B параметров) |
|---|---|---|---|
| Общий нормализованный балл | 62.3 | 61.4 | 52.5 – 59.6 |
| Скорость первого токена | Стандартная | В 1.3–3.5 раза быстрее конкурентов | Медленнее из-за большего числа токенов |
| Потребление памяти | Стандартное | Снижено на 24–65% | Выше |
| Устойчивость к ошибкам | Низкий уровень зацикливания (0.25%) | Аналогично | Выше (до 1.52%) |
Модель VisionPsy-Nano-460M опережает более крупные аналоги, такие как Qwen3.5-0.8B и InternVL3.5-1B, в задачах следования инструкциям и устойчивости к галлюцинациям. Например, в тесте на понимание инструкций (MM-IFEval) она показала результат 42.3, в то время как конкуренты набрали от 21.1 до 36.9.
Ключевой момент: Высокая скорость работы версии Flash достигается не за счет упрощения архитектуры, а за счет отказа от искусственного увеличения разрешения изображений. Обработка картинки в её нативном размере снижает нагрузку на процессор, что критично для автономных устройств с ограниченным запасом энергии.
Методология обучения и безопасность
Разработчики отказались от стратегии простого масштабирования данных, сосредоточившись на устранении конкретных ошибок. Обучение прошло пять этапов, включая поиск слабых мест с помощью «учителя» (модели Qwen3.6-27B) и слияние лучших версий модели.
Особое внимание уделено безопасности и надежности:
- Защита от зацикливания: Специальные алгоритмы снижают вероятность бесконечного повторения фраз до 0.25% (у аналогов этот показатель достигает 1.52%).
- Противодействие атакам: Модель прошла проверку на 288 сценариях злонамеренных запросов, включая попытки внедрения вредоносных инструкций через изображение. Процент успешной защиты составил 76.9%, что на 11 пунктов выше базовой версии.
- Ограничения: Модель работает преимущественно с английским языком и не предназначена для критически важных решений или обработки множества изображений одновременно.
Операционные последствия и практическое применение
Внедрение подобных моделей меняет подход к разработке мобильных приложений, где визуальный анализ ранее требовал постоянного интернета.
- Снижение зависимости от сети: Приложения смогут работать в режиме офлайн, что критично для регионов со слабой связью или в условиях повышенной нагрузки на каналы передачи данных.
- Конфиденциальность данных: Изображения и документы не покидают устройство пользователя, что исключает риски утечки чувствительной информации при передаче в облако.
- Требования к оборудованию: Для запуска моделей в режиме высокой производительности требуется поддержка стандарта GGUF и наличие достаточного объема оперативной памяти, хотя оптимизированная версия Flash работает даже на устройствах среднего класса.
- Доступность для разработчиков: Модели выпущены под лицензией Apache 2.0 с открытыми весами. Это позволяет интегрировать их в свои продукты без лицензионных отчислений, используя готовые инструменты для запуска на телефонах (llama.cpp) или серверах (vLLM).
Рынок получает инструмент, который делает мультимодальный ИИ доступным на уровне «карманного устройства», не требуя дорогостоящей серверной инфраструктуры.
Источник: huggingface.co