Агенты ИИ стали опасны: бизнес платит дважды за лицензии и риски утечек

Корпоративный ИИ превратился в автономного агента, который платит бизнесу двойной ценой: лицензионными отчислениями и риском фатальных утечек через скрытые промпт-инъекции. Единственный способ выжить в этой реальности — отказ от публичных облаков в пользу локальных кластеров и жесткий контроль реальных действий моделей, а не их слов.


Читать полностью

Календарь упоминаний. Страница 5:

2026
16 июля

Гибридный подход с LLM в ОТП Банке улучшает аналитику диалогов

Суть: Большие языковые модели в ОТП Банке работают в гибридной связке с машинным обучением для углубленного анализа клиентских диалогов и получения экономического эффекта.

Событие: Проект по ИИ-аналитике диалогов с участием больших языковых моделей вышел в финал премии Generation AI Awards.

Связь: Большие языковые модели совместно с ML-алгоритмами позволили банку лучше понимать клиентов, что стало ключевым фактором успеха проекта.

Подробнее →

15 июля

vLLM включен в программный стек NVIDIA для оптимизации энергоэффективности ИИ-систем

Суть: vLLM является частью интегрированного программного стека NVIDIA, включающего Dynamo, TensorRT LLM и SGLang, для реализации оптимизаций на уровне вычислений.

Фактор: Включение vLLM в стек позволяет реализовать технологии квантования NVFP4, раздельного обслуживания запросов и параллелизма экспертов для моделей типа MoE.

Эффект: Совместное использование vLLM с аппаратными платформами Blackwell и Vera Rubin обеспечивает многократный рост производительности на ватт без замены оборудования.

Подробнее →

09 июля

Модель Atom2.7m доказывает приоритет формата данных над размером параметров в математике

Суть: Компактная языковая модель Atom2.7m с 2,74 млн параметров превзошла гигантские системы в арифметике за счет структурированного представления чисел, а не увеличения объема параметров.

Событие: 7 июля 2026 года опубликовано исследование, показавшее, что модель Atom2.7m достигла точности 69,24% на бенчмарке ArithMark2.0, опередив модели, превосходящие её по масштабу в сотни раз.

Фактор: Языковая модель Atom2.7m обрабатывает цифры как атомарные элементы с явными метками разрядов и ролей, подавая их в обратном порядке от младшего к старшему.

Эффект: Внедрение специализированного формата ввода позволяет языковой модели выполнять точные вычисления на менее мощном оборудовании, снижая требования к вычислительным ресурсам.

Риск: Высокая точность языковой модели Atom2.7m подтверждена только на специфическом бенчмарке, что создает угрозу резкого падения эффективности при изменении формата ввода данных.

Подробнее →

09 июля

Библиотека transformers уравнивает скорость инференса больших языковых моделей с кастомными решениями vLLM

Суть: Обновление бэкенда библиотеки transformers позволяет большим языковым моделям достигать производительности, сопоставимой с нативными реализациями в vLLM, без необходимости ручной переписывания кода.

Событие: Тесты на архитектурах Qwen3 от 4 до 235 млрд параметров показали, что большие языковые модели в новой версии transformers не уступают или превосходят пропускную способность vLLM на кластере из 8 видеокарт H100.

Эффект: Большие языковые модели теперь могут использовать единый код для всего жизненного цикла — от обучения до продакшн-инференса, что устраняет разрыв между исследованиями и промышленным внедрением.

Фактор: Успешная автоматическая оптимизация больших языковых моделей напрямую зависит от соответствия их кода внутренним стандартам библиотеки transformers, что может ограничивать работу с нестандартными реализациями.

Риск: Большие языковые модели с архитектурой линейного внимания пока не поддерживаются новой системой ускорения, что требует временного использования старых методов инференса.

Подробнее →

08 июля

Исследование выявляет критическую ошибку токенизации при обучении языковых моделей с инструментами

Суть: Нарушение инварианта «Токен-вход, Токен-выход» при повторной токенизации диалога делает градиентный спуск некорректным и ломает обучение языковых моделей в агентном режиме.

Событие: Тестирование на Hugging Face показало, что базовая версия языковой модели Qwen3 нарушает свойство сохранения префикса, требуя исправления шаблона для корректной работы.

Эффект: Применение метода буферизации токенов и расчета дельты гарантирует, что языковые модели оптимизируются исключительно по реально сгенерированным последовательностям.

Фактор: Повторное кодирование текста после вызова внешних инструментов создает «призрачные» токены, из-за которых языковые модели теряют способность различать свои ответы и данные от инструментов.

Подробнее →



В нашей базе собрано 61 событие по теме «Большие языковые модели (LLM)». Мы показываем 50 последних из них.
Объединили похожие карточки: Большие языковые модели (LLM); Модели больших языковых систем; Модели глубокого обучения и другие.