PyTorch замедляет ИИ в 3,7 раза: скрытые настройки и риски изоляции
Стандартные настройки PyTorch тормозят вычисления в 3,7 раза и оставляют до 90% мощностей архитектуры «смесь экспертов» без работы. Бизнесу придется перестраивать инфраструктуру и искать альтернативные ускорители, чтобы избежать простоев и регуляторных рисков на фоне угроз экспортных ограничений. / Страница 2
Читать полностью
Календарь упоминаний. Страница 2:
BaseRT отказывается от PyTorch для прямой работы с Metal на Apple Silicon
Суть: Новый движок BaseRT для запуска больших языковых моделей на процессорах Apple Silicon написан с нуля и функционирует без использования фреймворка PyTorch.
Фактор: Архитектура инструмента исключает зависимость от PyTorch, CoreML или MLX, что позволяет коду на C++ обращаться к видеокарте напрямую через API Metal.
Эффект: Отказ от промежуточных слоев абстракции, включая PyTorch, обеспечил ускорение декодирования на чипах M3 и M4 Pro до 1,56 раза по сравнению с llama.cpp.
Hugging Face Kernels вводит поддержку Torch Stable ABI для совместимости с PyTorch
Суть: Обновление проекта Hugging Face Kernels вводит стандарт Torch Stable ABI, позволяя создавать вычислительные ядра, совместимые с конкретной версией PyTorch и всеми последующими в течение двух лет.
Фактор: PyTorch теперь поддерживает создание ядер, которые будут работать с версиями фреймворка начиная от 2.9, что упрощает долгосрочное использование кастомных решений.
Связь: Внедрение стандарта Apache TVM FFI позволяет ядрам, разработанным для PyTorch, функционировать также в экосистемах Jax и CuPy без переписывания кода.
Тренд: PyTorch становится частью модульного инструментария, где утилиты для сборки и загрузки ядер разделены, что упрощает интеграцию в рабочие процессы.
Модели PP-OCRv6 доступны для запуска в экосистеме PyTorch через интерфейс Transformers
Суть: Семейство моделей PP-OCRv6 поддерживает работу в среде PyTorch благодаря интеграции с библиотекой Transformers, что позволяет использовать их разработчикам этой экосистемы.
Фактор: Платформа PaddleOCR версии 3.7 предоставляет единый интерфейс, позволяющий подключать движок PyTorch через конфигурацию наряду с нативным Paddle Inference и ONNX Runtime.
Эффект: Возможность запуска моделей в PyTorch снижает порог входа для внедрения технологии, делая её доступной для широкого круга разработчиков, не привязанных к экосистеме PaddlePaddle.
Ядра TransformerEngine в NeMo AutoModel ускоряют вычисления на базе PyTorch
Суть: Библиотека NeMo AutoModel использует оптимизированные ядра TransformerEngine для реализации внимания и линейных слоев, которые работают быстрее стандартных библиотек PyTorch.
Фактор: Применение специализированных ядер позволяет перекрывать время передачи данных временем выполнения операций, устраняя простои в стандартной реализации PyTorch.
Эффект: Интеграция этих оптимизаций обеспечивает снижение потребления видеопамяти GPU на 29–32% по сравнению с нативной реализацией в PyTorch.
Пример реализации KV Caching на PyTorch ускоряет генерацию текста в 5,21 раза
Суть: Технология кэширования ключей и значений, реализованная в PyTorch, позволяет избежать повторных вычислений контекста при генерации больших языковых моделей.
Исследование: Бенчмарк модели SmolLM2-1.7B на PyTorch показал сокращение времени вывода с 1 минуты 1 секунды до 11,7 секунды при генерации 300 токенов.
Фактор: В коде на PyTorch механизм работает через создание хранилища для последовательной конкатенации новых векторов ключей и значений.
Риск: Использование PyTorch с активным кэшированием требует увеличения объема видеопамяти для хранения истории всех предыдущих вычислений.
В нашей базе собрано 18 событий по теме «Torch». Мы показываем все из них.
Объединили похожие карточки: Torch; PyTorch и другие.