Агент Shippy на базе Claude Opus 4.6 снижает риски ошибок в анализе морских данных
ИИ-агент Shippy уже помогает 300 партнерам в 70 странах отслеживать незаконный вылов рыбы, заменяя рутинный анализ живыми данными со спутников. Разработчики перестали гнаться за умными текстами и создали жесткую систему защиты, где алгоритм не имеет права выдумывать факты или выходить за рамки своих полномочий.
Команда Ai2 представила Shippy — специализированного ИИ-агента для анализа морской обстановки, способного работать с живыми данными спутников и судов. В отличие от обычных чат-ботов, система разработана для задач, где ошибка стоит ресурсов и безопасности людей, поэтому её архитектура построена на строгом контроле, а не на простом генерировании текста. Проект уже используется более чем 300 партнерами в 70 странах для мониторинга рыболовства и защиты морских зон.
Важный нюанс: Разработчики сместили фокус с улучшения самого языкового модели на создание надежной инфраструктуры, гарантирующей, что агент не выдумает данные и не выйдет за рамки своих полномочий.
Архитектура: как агент знает, что делать, а что нет
Система Shippy разделена на три независимых компонента, что позволяет обновлять её части без полной пересборки. «Душа» агента — это системный промпт, задающий личность и границы поведения. «Навыки» описывают конкретные действия в виде файлов с инструкциями. «Конфигурация» управляет запуском, выбирая модель и среду исполнения.
Текущая версия использует модель Claude Opus 4.6 и фреймворк OpenClaw. Ключевые навыки агента включают:
- Запрос событий через API платформы Skylight (например, поиск незаконного вылова или пересадки груза).
- Определение границ исключительных экономических зон (EEZ) и морских охраняемых районов (MPA).
- Интерпретация траекторий судов на основе сигналов их движения.
- Генерация интерактивных ссылок на карты для мгновенной проверки данных аналитиком.
Агент не делает юридических выводов о нарушениях и не строит догадок вне рамок предоставленных данных. Эти ограничения прописаны явно в промпте, что делает их прозрачными и проверяемыми.
Детерминированные инструменты для недетерминированной модели
Языковые модели по своей природе непредсказуемы, но инструменты, которыми они пользуются, должны работать без сбоев. В ранних версиях Shippy самостоятельно формировал запросы к API, что приводило к ошибкам в фильтрации и потере данных. Для решения этой проблемы была создана специальная командная строка (CLI).
Теперь агент не пишет код запроса, а использует готовые команды, например skylight events search. CLI берет на себя аутентификацию, пагинацию и форматирование вывода. Результаты записываются в локальные файлы JSON, что исключает проблемы с переполнением буфера при передаче больших объемов данных.
Стоит учесть: Разделение логики на уровни (API, CLI, навыки) позволяет тестировать каждый компонент отдельно. Если агент ошибается, инженеры точно знают, где искать проблему: в данных, в инструменте или в инструкции.
Изоляция данных и безопасность сессий
Платформа Skylight обслуживает государственные органы и НКО, где утечка данных недопустима. Рыболовный инспектор в Филиппинах должен видеть только свои списки наблюдения и зоны интереса. Для обеспечения этого Shippy работает в изолированных сессиях.
Каждый запуск диалога создает отдельное развертывание в Kubernetes через платформу Mothership. В эту среду внедряется токен доступа конкретного пользователя, поэтому все запросы агента ограничены его правами. Файлы, создаваемые агентом в ходе анализа, существуют только внутри этой сессии и исчезают после её завершения. Сеть внутри песочницы ограничена только необходимыми сервисами.
Оценка эффективности: тестирование на реальных задачах
Стандартные бенчмарки не подходят для оценки агентов, работающих в реальных рабочих процессах. Команда Ai2 создала собственную систему оценки, где эксперты по предмету пишут сценарии и критерии.
Процесс проверки включает:
- Запуск естественного запроса в песочнице.
- Оценку ответа моделью-судьей по шкале от 0 до 1 с обоснованием.
- Сравнение взвешенного результата с пороговым значением.
Оценка учитывает важность разных критериев: для запроса о рыболовстве точность данных важнее стиля ответа. Система автоматически блокирует версии Shippy, которые показывают регрессию в тестах. В последних запусках выявлены проблемы с тактическими рекомендациями (агент должен лишь поддерживать принятие решений, а не давать приказы) и ошибками при упрощении геометрии границ.
Важный нюанс: Агенты не просто генерируют текст, они выполняют цепочки действий. Поэтому тестирование должно происходить на живых данных и в условиях реальной изоляции, а не на статических наборах вопросов.
Операционные последствия и развитие
- Снижение порогов входа: Использование готовых навыков и CLI позволяет внедрять сложные аналитические системы без необходимости писать код для каждого нового запроса.
- Риск галлюцинаций в критических зонах: Несмотря на строгие рамки, агент может ошибаться в геометрических расчетах или выдумывать несуществующие команды, что требует постоянного мониторинга и доработки навыков.
- Масштабируемость: Платформа Mothership изначально спроектирована для универсального использования, что позволит развертывать подобные агенты в других сферах, например, в экологическом мониторинге (EarthRanger) или анализе спутниковых снимков (OlmoEarth).
В ближайшее время разработчики планируют внедрить управление интерфейсом карты напрямую через агента, маршрутизацию запросов на разные модели (простые задачи — на быстрые, сложные — на мощные) и создание долговременной памяти для сохранения предпочтений аналитиков между сессиями.
Источник: huggingface.co