Агенты ИИ стали опасны: бизнес платит дважды за лицензии и риски утечек
Корпоративный ИИ превратился в автономного агента, который платит бизнесу двойной ценой: лицензионными отчислениями и риском фатальных утечек через скрытые промпт-инъекции. Единственный способ выжить в этой реальности — отказ от публичных облаков в пользу локальных кластеров и жесткий контроль реальных действий моделей, а не их слов.
Читать полностью
Календарь упоминаний. Страница 5:
Гибридный подход с LLM в ОТП Банке улучшает аналитику диалогов
Суть: Большие языковые модели в ОТП Банке работают в гибридной связке с машинным обучением для углубленного анализа клиентских диалогов и получения экономического эффекта.
Событие: Проект по ИИ-аналитике диалогов с участием больших языковых моделей вышел в финал премии Generation AI Awards.
Связь: Большие языковые модели совместно с ML-алгоритмами позволили банку лучше понимать клиентов, что стало ключевым фактором успеха проекта.
vLLM включен в программный стек NVIDIA для оптимизации энергоэффективности ИИ-систем
Суть: vLLM является частью интегрированного программного стека NVIDIA, включающего Dynamo, TensorRT LLM и SGLang, для реализации оптимизаций на уровне вычислений.
Фактор: Включение vLLM в стек позволяет реализовать технологии квантования NVFP4, раздельного обслуживания запросов и параллелизма экспертов для моделей типа MoE.
Эффект: Совместное использование vLLM с аппаратными платформами Blackwell и Vera Rubin обеспечивает многократный рост производительности на ватт без замены оборудования.
Модель Atom2.7m доказывает приоритет формата данных над размером параметров в математике
Суть: Компактная языковая модель Atom2.7m с 2,74 млн параметров превзошла гигантские системы в арифметике за счет структурированного представления чисел, а не увеличения объема параметров.
Событие: 7 июля 2026 года опубликовано исследование, показавшее, что модель Atom2.7m достигла точности 69,24% на бенчмарке ArithMark2.0, опередив модели, превосходящие её по масштабу в сотни раз.
Фактор: Языковая модель Atom2.7m обрабатывает цифры как атомарные элементы с явными метками разрядов и ролей, подавая их в обратном порядке от младшего к старшему.
Эффект: Внедрение специализированного формата ввода позволяет языковой модели выполнять точные вычисления на менее мощном оборудовании, снижая требования к вычислительным ресурсам.
Риск: Высокая точность языковой модели Atom2.7m подтверждена только на специфическом бенчмарке, что создает угрозу резкого падения эффективности при изменении формата ввода данных.
Библиотека transformers уравнивает скорость инференса больших языковых моделей с кастомными решениями vLLM
Суть: Обновление бэкенда библиотеки transformers позволяет большим языковым моделям достигать производительности, сопоставимой с нативными реализациями в vLLM, без необходимости ручной переписывания кода.
Событие: Тесты на архитектурах Qwen3 от 4 до 235 млрд параметров показали, что большие языковые модели в новой версии transformers не уступают или превосходят пропускную способность vLLM на кластере из 8 видеокарт H100.
Эффект: Большие языковые модели теперь могут использовать единый код для всего жизненного цикла — от обучения до продакшн-инференса, что устраняет разрыв между исследованиями и промышленным внедрением.
Фактор: Успешная автоматическая оптимизация больших языковых моделей напрямую зависит от соответствия их кода внутренним стандартам библиотеки transformers, что может ограничивать работу с нестандартными реализациями.
Риск: Большие языковые модели с архитектурой линейного внимания пока не поддерживаются новой системой ускорения, что требует временного использования старых методов инференса.
Исследование выявляет критическую ошибку токенизации при обучении языковых моделей с инструментами
Суть: Нарушение инварианта «Токен-вход, Токен-выход» при повторной токенизации диалога делает градиентный спуск некорректным и ломает обучение языковых моделей в агентном режиме.
Событие: Тестирование на Hugging Face показало, что базовая версия языковой модели Qwen3 нарушает свойство сохранения префикса, требуя исправления шаблона для корректной работы.
Эффект: Применение метода буферизации токенов и расчета дельты гарантирует, что языковые модели оптимизируются исключительно по реально сгенерированным последовательностям.
Фактор: Повторное кодирование текста после вызова внешних инструментов создает «призрачные» токены, из-за которых языковые модели теряют способность различать свои ответы и данные от инструментов.
В нашей базе собрано 61 событие по теме «Большие языковые модели (LLM)». Мы показываем 50 последних из них.
Объединили похожие карточки: Большие языковые модели (LLM); Модели больших языковых систем; Модели глубокого обучения и другие.