Июль 2026   |   В фокусе

Агент Shippy на базе Claude Opus 4.6 снижает риски ошибок в анализе морских данных

ИИ-агент Shippy уже помогает 300 партнерам в 70 странах отслеживать незаконный вылов рыбы, заменяя рутинный анализ живыми данными со спутников. Разработчики перестали гнаться за умными текстами и создали жесткую систему защиты, где алгоритм не имеет права выдумывать факты или выходить за рамки своих полномочий.

Команда Ai2 представила Shippy — специализированного ИИ-агента для анализа морской обстановки, способного работать с живыми данными спутников и судов. В отличие от обычных чат-ботов, система разработана для задач, где ошибка стоит ресурсов и безопасности людей, поэтому её архитектура построена на строгом контроле, а не на простом генерировании текста. Проект уже используется более чем 300 партнерами в 70 странах для мониторинга рыболовства и защиты морских зон.

Важный нюанс: Разработчики сместили фокус с улучшения самого языкового модели на создание надежной инфраструктуры, гарантирующей, что агент не выдумает данные и не выйдет за рамки своих полномочий.

Архитектура: как агент знает, что делать, а что нет

Система Shippy разделена на три независимых компонента, что позволяет обновлять её части без полной пересборки. «Душа» агента — это системный промпт, задающий личность и границы поведения. «Навыки» описывают конкретные действия в виде файлов с инструкциями. «Конфигурация» управляет запуском, выбирая модель и среду исполнения.

Текущая версия использует модель Claude Opus 4.6 и фреймворк OpenClaw. Ключевые навыки агента включают:

  • Запрос событий через API платформы Skylight (например, поиск незаконного вылова или пересадки груза).
  • Определение границ исключительных экономических зон (EEZ) и морских охраняемых районов (MPA).
  • Интерпретация траекторий судов на основе сигналов их движения.
  • Генерация интерактивных ссылок на карты для мгновенной проверки данных аналитиком.

Агент не делает юридических выводов о нарушениях и не строит догадок вне рамок предоставленных данных. Эти ограничения прописаны явно в промпте, что делает их прозрачными и проверяемыми.

Детерминированные инструменты для недетерминированной модели

Языковые модели по своей природе непредсказуемы, но инструменты, которыми они пользуются, должны работать без сбоев. В ранних версиях Shippy самостоятельно формировал запросы к API, что приводило к ошибкам в фильтрации и потере данных. Для решения этой проблемы была создана специальная командная строка (CLI).

Теперь агент не пишет код запроса, а использует готовые команды, например skylight events search. CLI берет на себя аутентификацию, пагинацию и форматирование вывода. Результаты записываются в локальные файлы JSON, что исключает проблемы с переполнением буфера при передаче больших объемов данных.

Стоит учесть: Разделение логики на уровни (API, CLI, навыки) позволяет тестировать каждый компонент отдельно. Если агент ошибается, инженеры точно знают, где искать проблему: в данных, в инструменте или в инструкции.

Изоляция данных и безопасность сессий

Платформа Skylight обслуживает государственные органы и НКО, где утечка данных недопустима. Рыболовный инспектор в Филиппинах должен видеть только свои списки наблюдения и зоны интереса. Для обеспечения этого Shippy работает в изолированных сессиях.

Каждый запуск диалога создает отдельное развертывание в Kubernetes через платформу Mothership. В эту среду внедряется токен доступа конкретного пользователя, поэтому все запросы агента ограничены его правами. Файлы, создаваемые агентом в ходе анализа, существуют только внутри этой сессии и исчезают после её завершения. Сеть внутри песочницы ограничена только необходимыми сервисами.

Оценка эффективности: тестирование на реальных задачах

Стандартные бенчмарки не подходят для оценки агентов, работающих в реальных рабочих процессах. Команда Ai2 создала собственную систему оценки, где эксперты по предмету пишут сценарии и критерии.

Процесс проверки включает:

  1. Запуск естественного запроса в песочнице.
  2. Оценку ответа моделью-судьей по шкале от 0 до 1 с обоснованием.
  3. Сравнение взвешенного результата с пороговым значением.

Оценка учитывает важность разных критериев: для запроса о рыболовстве точность данных важнее стиля ответа. Система автоматически блокирует версии Shippy, которые показывают регрессию в тестах. В последних запусках выявлены проблемы с тактическими рекомендациями (агент должен лишь поддерживать принятие решений, а не давать приказы) и ошибками при упрощении геометрии границ.

Важный нюанс: Агенты не просто генерируют текст, они выполняют цепочки действий. Поэтому тестирование должно происходить на живых данных и в условиях реальной изоляции, а не на статических наборах вопросов.

Операционные последствия и развитие

  • Снижение порогов входа: Использование готовых навыков и CLI позволяет внедрять сложные аналитические системы без необходимости писать код для каждого нового запроса.
  • Риск галлюцинаций в критических зонах: Несмотря на строгие рамки, агент может ошибаться в геометрических расчетах или выдумывать несуществующие команды, что требует постоянного мониторинга и доработки навыков.
  • Масштабируемость: Платформа Mothership изначально спроектирована для универсального использования, что позволит развертывать подобные агенты в других сферах, например, в экологическом мониторинге (EarthRanger) или анализе спутниковых снимков (OlmoEarth).

В ближайшее время разработчики планируют внедрить управление интерфейсом карты напрямую через агента, маршрутизацию запросов на разные модели (простые задачи — на быстрые, сложные — на мощные) и создание долговременной памяти для сохранения предпочтений аналитиков между сессиями.

Коротко о главном

Как архитектура из трех независимых компонентов обеспечивает гибкость системы Shippy?

Разделение на системный промпт, файлы навыков и конфигурацию позволяет обновлять отдельные части без полной пересборки, что упрощает поддержку и развитие. Текущая версия использует модель Claude Opus 4.6 и фреймворк OpenClaw для выполнения конкретных действий, таких как запрос событий через API Skylight.

Зачем была внедрена специальная командная строка (CLI) вместо самостоятельного формирования запросов агентом?

В ранних версиях агент сам писал код запросов, что приводило к ошибкам фильтрации и потере данных из-за непредсказуемости языковых моделей. CLI берет на себя аутентификацию и форматирование, записывая результаты в локальные JSON-файлы, чтобы исключить переполнение буфера при обработке больших объемов информации.

Как обеспечивается изоляция данных для государственных органов и НКО, работающих с платформой Skylight?

Каждый запуск диалога создает отдельное развертывание в Kubernetes через платформу Mothership, куда внедряется токен доступа конкретного пользователя. Это гарантирует, что инспектор видит только свои списки наблюдения, а созданные файлы исчезают сразу после завершения сессии, предотвращая утечки.

Почему стандартные бенчмарки не подходят для оценки эффективности агента Shippy?

Агенты выполняют цепочки действий в реальных рабочих процессах, поэтому тестирование на статических наборах вопросов не отражает их реальной работы с живыми данными. Команда Ai2 создала систему оценки с участием экспертов, где модель-судья проверяет ответы по шкале от 0 до 1 с учетом важности точности данных для конкретных сценариев.

Какие критические ошибки были выявлены при тестировании последних версий Shippy?

В ходе проверок обнаружились проблемы с тактическими рекомендациями, когда агент пытался отдавать приказы вместо поддержки решений, а также ошибки при упрощении геометрии границ. Система автоматически блокирует такие версии, чтобы предотвратить регрессию в работе до устранения недостатков.

Какие будущие улучшения планируются для расширения возможностей агента?

Разработчики намерены внедрить прямое управление интерфейсом карты через агента и маршрутизацию запросов на разные модели в зависимости от сложности задачи. Также планируется создание долговременной памяти для сохранения предпочтений аналитиков между сессиями, что повысит персонализацию работы.

Инфографика событий

Открыть инфографику на весь экран


Участники и связи

Отрасли: ИТ и программное обеспечение; Искусственный интеллект (AI); Кибербезопасность; Передовые технологии

Материалы по теме