Июль 2026   |   В фокусе

Tether AI представила VisionPsy-Nano для смартфонов — работа без интернета и защита от утечек

Модели VisionPsy-Nano от Tether AI Research доказывают, что смартфон способен анализировать изображения быстрее и точнее, чем облачные сервисы, при этом работая полностью без интернета. Разработчики предлагают выбор между максимальной точностью и мгновенным откликом, что позволяет бизнесу внедрять ИИ-аналитику в приложения без риска утечки данных и зависимости от качества связи.

Лаборатория Tether AI Research представила семейство моделей VisionPsy-Nano, созданных специально для работы на мобильных устройствах без подключения к облаку. Эти модели весом около 460 миллионов параметров демонстрируют лучшие результаты в своем классе, превосходя аналоги по точности и скорости на 16 из 17 тестовых задач. Разработчики предлагают два варианта: VisionPsy-Nano-460M для максимальной точности и VisionPsy-Nano-460M-Flash для мгновенного отклика на смартфоне.

Важный нюанс: Переход на локальные модели смещает фокус с простого уменьшения размера нейросети на оптимизацию обработки визуальных данных. Снижение количества визуальных токенов (единиц изображения) позволяет ускорить работу в разы, не жертвуя качеством понимания сцены.

Два подхода к работе на устройстве

Семейство моделей решает главную проблему мобильных ИИ: необходимость выбирать между качеством ответа и скоростью его получения. Tether AI Research предлагает гибкое решение, разделяя задачи на два типа.

  • VisionPsy-Nano-460M: Оптимизирован для точности. Этот вариант подходит для сложных задач, где важна детализация, например, анализ документов, чтение графиков или решение логических задач. Он лидирует в категориях понимания текста, визуального восприятия и рассуждений.
  • VisionPsy-Nano-460M-Flash: Создан для скорости. Модель использует меньше визуальных токенов, что позволяет сократить время до появления первого слова ответа. На устройствах iPhone 15 и Galaxy S25 Ultra она работает в 19–36 раз быстрее аналогов при сохранении 99% качества исходной модели.

Оба варианта работают в режиме одного изображения на запрос, что позволяет концентрировать вычислительные ресурсы на глубоком анализе конкретной сцены, а не на обработке потоков данных.

Производительность и сравнение с конкурентами

Тестирование проводилось на реальном оборудовании, включая Pixel 9, Galaxy S23, Galaxy S25 Ultra и iPhone 15. Результаты показывают, что компактная архитектура может конкурировать с моделями, в два раза превышающими её по размеру.

ХарактеристикаVisionPsy-Nano-460MVisionPsy-Nano-460M-FlashКонкуренты (0.75–1B параметров)
Общий нормализованный балл62.361.452.5 – 59.6
Скорость первого токенаСтандартнаяВ 1.3–3.5 раза быстрее конкурентовМедленнее из-за большего числа токенов
Потребление памятиСтандартноеСнижено на 24–65%Выше
Устойчивость к ошибкамНизкий уровень зацикливания (0.25%)АналогичноВыше (до 1.52%)

Модель VisionPsy-Nano-460M опережает более крупные аналоги, такие как Qwen3.5-0.8B и InternVL3.5-1B, в задачах следования инструкциям и устойчивости к галлюцинациям. Например, в тесте на понимание инструкций (MM-IFEval) она показала результат 42.3, в то время как конкуренты набрали от 21.1 до 36.9.

Ключевой момент: Высокая скорость работы версии Flash достигается не за счет упрощения архитектуры, а за счет отказа от искусственного увеличения разрешения изображений. Обработка картинки в её нативном размере снижает нагрузку на процессор, что критично для автономных устройств с ограниченным запасом энергии.

Методология обучения и безопасность

Разработчики отказались от стратегии простого масштабирования данных, сосредоточившись на устранении конкретных ошибок. Обучение прошло пять этапов, включая поиск слабых мест с помощью «учителя» (модели Qwen3.6-27B) и слияние лучших версий модели.

Особое внимание уделено безопасности и надежности:

  • Защита от зацикливания: Специальные алгоритмы снижают вероятность бесконечного повторения фраз до 0.25% (у аналогов этот показатель достигает 1.52%).
  • Противодействие атакам: Модель прошла проверку на 288 сценариях злонамеренных запросов, включая попытки внедрения вредоносных инструкций через изображение. Процент успешной защиты составил 76.9%, что на 11 пунктов выше базовой версии.
  • Ограничения: Модель работает преимущественно с английским языком и не предназначена для критически важных решений или обработки множества изображений одновременно.

Операционные последствия и практическое применение

Внедрение подобных моделей меняет подход к разработке мобильных приложений, где визуальный анализ ранее требовал постоянного интернета.

  • Снижение зависимости от сети: Приложения смогут работать в режиме офлайн, что критично для регионов со слабой связью или в условиях повышенной нагрузки на каналы передачи данных.
  • Конфиденциальность данных: Изображения и документы не покидают устройство пользователя, что исключает риски утечки чувствительной информации при передаче в облако.
  • Требования к оборудованию: Для запуска моделей в режиме высокой производительности требуется поддержка стандарта GGUF и наличие достаточного объема оперативной памяти, хотя оптимизированная версия Flash работает даже на устройствах среднего класса.
  • Доступность для разработчиков: Модели выпущены под лицензией Apache 2.0 с открытыми весами. Это позволяет интегрировать их в свои продукты без лицензионных отчислений, используя готовые инструменты для запуска на телефонах (llama.cpp) или серверах (vLLM).

Рынок получает инструмент, который делает мультимодальный ИИ доступным на уровне «карманного устройства», не требуя дорогостоящей серверной инфраструктуры.

Коротко о главном

Почему версия VisionPsy-Nano-460M-Flash работает в 19–36 раз быстрее на смартфонах?

Модель достигает высокой скорости на iPhone 15 и Galaxy S25 Ultra за счет отказа от искусственного увеличения разрешения изображений и обработки их в нативном размере. Такое решение снижает нагрузку на процессор и сохраняет 99% качества исходной модели при мгновенном отклике.

Как VisionPsy-Nano-460M превосходит более крупные модели в тестах на инструкции?

В тесте MM-IFEval модель набрала 42.3 балла, опередив аналоги с весом 0.8–1 миллиард параметров, которые показали результат от 21.1 до 36.9. Это преимущество обусловлено специализированным обучением, направленным на устранение конкретных ошибок, а не на простое масштабирование данных.

Каким образом разработчики снизили риск зацикливания модели до 0.25%?

Внедрение специальных алгоритмов защиты позволило уменьшить вероятность бесконечного повторения фраз до 0.25%, в то время как у конкурентов этот показатель достигает 1.52%. Эффект достигнут благодаря пятиэтапному процессу обучения с использованием «учителя» (модели Qwen3.6-27B) для поиска слабых мест.

Какой уровень защиты от злонамеренных запросов демонстрирует модель?

Система успешно отразила 76.9% атак из 288 сценариев, что на 11 процентных пунктов выше, чем у базовой версии. Повышенная устойчивость достигнута за счет целенаправленной проверки на внедрение вредоносных инструкций через изображения на этапе обучения.

Какие практические преимущества дает локальный запуск моделей для пользователей?

Работа без подключения к облаку исключает риски утечки чувствительной информации и позволяет приложениям функционировать в режиме офлайн. Это критично для регионов со слабой связью, так как изображения и документы не покидают устройство пользователя.

При каких условиях разработчики могут бесплатно интегрировать эти модели в свои продукты?

Модели выпущены под лицензией Apache 2.0 с открытыми весами, что позволяет использовать их без лицензионных отчислений. Для запуска доступны готовые инструменты, такие как llama.cpp для телефонов и vLLM для серверов, при наличии поддержки стандарта GGUF.

Инфографика событий

Открыть инфографику на весь экран


Участники и связи

Отрасли: ИТ и программное обеспечение; Искусственный интеллект (AI); Устройства и гаджеты; Смартфоны и телефоны; Передовые технологии

Материалы по теме