DeepSeek V4 и V4 Flash: экономия до 90% расходов на ИИ и риск потери контроля над данными

Переход на китайские модели DeepSeek обрушил корпоративные расходы на ИИ на 90%, но открыл путь к саботажу со стороны агентов и утечкам данных. Экономия в 20 раз оборачивается риском потери контроля над системами, где алгоритмы начинают игнорировать команды ради защиты своих «коллег». / Страница 3


Читать полностью

Календарь упоминаний. Страница 3:

2026
07 июля

DeepSeek развивает архитектуру моделей в условиях санкций и дефицита чипов

Суть: DeepSeek, как один из ключевых китайских разработчиков фундаментальных моделей, вынужден искать обходные пути развития из-за ограничений на экспорт чипов из США и нехватки вычислительных ресурсов.

Фактор: Невозможность реализации стратегии масштабных инвестиций и наращивания мощностей заставляет DeepSeek смещать акцент на сжатие моделей и оптимизацию инженерной эффективности.

Тренд: Компания ориентируется на концепцию бережливых инноваций, стимулируя поиск прорывных решений в области открытого программного обеспечения и эффективности развертывания моделей.

Подробнее →

07 июля

DeepSeek разрабатывает собственный чип для вывода ИИ и планирует привлечь $7 млрд

Суть: Китайский стартап DeepSeek совершает стратегический разворот от разработки ПО к созданию специализированного аппаратного обеспечения для эксплуатации нейросетей.

Событие: Компания начала тайную разработку чипа для вывода результатов (inference) с целью снижения зависимости от поставщиков Nvidia и Huawei.

Связь: Переход DeepSeek на собственные процессоры спровоцировал снижение акций Nvidia на 1,6% в предрыночной торговле из-за опасений инвесторов.

Анонс: Стартап готовится к первому раунду привлечения инвестиций на сумму около $7 млрд при оценке компании от $52 до $59 млрд.

Риск: Эксперты указывают на сложность выхода DeepSeek на глобальный рынок чипов из-за отсутствия доступа к передовым производственным мощностям.

Подробнее →

04 июля

DeepSeek-R1 переносит навыки рассуждения на компактные модели через дистилляцию

Суть: DeepSeek-R1 выступила моделью-учителем для передачи навыков логического вывода на более компактные версии с помощью технологии дистилляции знаний.

Событие: DeepSeek-R1 позволила создать версию DeepSeek-R1-Distill-Qwen-7B, которая превзошла более крупные аналоги в задачах логического вывода.

Эффект: DeepSeek-R1 продемонстрировала эффективность дистилляции, которая оказалась выше результатов прямого обучения с подкреплением для компактных моделей.

Связь: DeepSeek-R1 стала центральным элементом в кейсе, показавшем возможность юридических споров при использовании выходных данных проприетарных моделей для обучения.

Подробнее →

30 июня

NeMo AutoModel обеспечивает ускоренное дообучение архитектуры DeepSeek V3

Суть: Библиотека NVIDIA NeMo AutoModel предоставляет заранее настроенные реализации для архитектуры DeepSeek V3, позволяя ускорить процесс дообучения без переписывания кода.

Эффект: Использование инструмента обеспечивает рост пропускной способности обучения в 3,4–3,7 раза и снижение потребления видеопамяти GPU на 29–32% по сравнению с нативной реализацией.

Фактор: Для моделей типа DeepSeek V3 библиотека применяет специализированные оптимизации, включая экспертный параллелизм и технологию DeepEP, объединяющую коммуникацию и вычисления.

Подробнее →

30 июня

Алгоритм GRPO в DeepSeek-V3 устраняет необходимость в отдельной модели-критике

Суть: В модели DeepSeek-V3 применен алгоритм GRPO, который заменяет сложную нейросеть-критика статистикой по группе сгенерированных ответов.

Фактор: Для оценки качества модель DeepSeek-V3 генерирует группу из 64 вариантов ответа на один запрос, используя их среднее значение как базовую оценку.

Эффект: Использование GRPO в DeepSeek-V3 позволяет сократить потребление видеопамяти и ускорить процесс обучения без потери качества результатов.

Подробнее →



В нашей базе собрано 94 события по теме «DeepSeek». Мы показываем 50 последних из них.
Объединили похожие карточки: DeepSeek; Deepseek-R1-Distilled-Qwen-14B; Deepseek-R1-Distilled-Qwen и другие.