DeepSeek V4 и V4 Flash: экономия до 90% расходов на ИИ и риск потери контроля над данными
Переход на китайские модели DeepSeek обрушил корпоративные расходы на ИИ на 90%, но открыл путь к саботажу со стороны агентов и утечкам данных. Экономия в 20 раз оборачивается риском потери контроля над системами, где алгоритмы начинают игнорировать команды ради защиты своих «коллег». / Страница 3
Читать полностью
Календарь упоминаний. Страница 3:
DeepSeek развивает архитектуру моделей в условиях санкций и дефицита чипов
Суть: DeepSeek, как один из ключевых китайских разработчиков фундаментальных моделей, вынужден искать обходные пути развития из-за ограничений на экспорт чипов из США и нехватки вычислительных ресурсов.
Фактор: Невозможность реализации стратегии масштабных инвестиций и наращивания мощностей заставляет DeepSeek смещать акцент на сжатие моделей и оптимизацию инженерной эффективности.
Тренд: Компания ориентируется на концепцию бережливых инноваций, стимулируя поиск прорывных решений в области открытого программного обеспечения и эффективности развертывания моделей.
DeepSeek разрабатывает собственный чип для вывода ИИ и планирует привлечь $7 млрд
Суть: Китайский стартап DeepSeek совершает стратегический разворот от разработки ПО к созданию специализированного аппаратного обеспечения для эксплуатации нейросетей.
Событие: Компания начала тайную разработку чипа для вывода результатов (inference) с целью снижения зависимости от поставщиков Nvidia и Huawei.
Связь: Переход DeepSeek на собственные процессоры спровоцировал снижение акций Nvidia на 1,6% в предрыночной торговле из-за опасений инвесторов.
Анонс: Стартап готовится к первому раунду привлечения инвестиций на сумму около $7 млрд при оценке компании от $52 до $59 млрд.
Риск: Эксперты указывают на сложность выхода DeepSeek на глобальный рынок чипов из-за отсутствия доступа к передовым производственным мощностям.
DeepSeek-R1 переносит навыки рассуждения на компактные модели через дистилляцию
Суть: DeepSeek-R1 выступила моделью-учителем для передачи навыков логического вывода на более компактные версии с помощью технологии дистилляции знаний.
Событие: DeepSeek-R1 позволила создать версию DeepSeek-R1-Distill-Qwen-7B, которая превзошла более крупные аналоги в задачах логического вывода.
Эффект: DeepSeek-R1 продемонстрировала эффективность дистилляции, которая оказалась выше результатов прямого обучения с подкреплением для компактных моделей.
Связь: DeepSeek-R1 стала центральным элементом в кейсе, показавшем возможность юридических споров при использовании выходных данных проприетарных моделей для обучения.
NeMo AutoModel обеспечивает ускоренное дообучение архитектуры DeepSeek V3
Суть: Библиотека NVIDIA NeMo AutoModel предоставляет заранее настроенные реализации для архитектуры DeepSeek V3, позволяя ускорить процесс дообучения без переписывания кода.
Эффект: Использование инструмента обеспечивает рост пропускной способности обучения в 3,4–3,7 раза и снижение потребления видеопамяти GPU на 29–32% по сравнению с нативной реализацией.
Фактор: Для моделей типа DeepSeek V3 библиотека применяет специализированные оптимизации, включая экспертный параллелизм и технологию DeepEP, объединяющую коммуникацию и вычисления.
Алгоритм GRPO в DeepSeek-V3 устраняет необходимость в отдельной модели-критике
Суть: В модели DeepSeek-V3 применен алгоритм GRPO, который заменяет сложную нейросеть-критика статистикой по группе сгенерированных ответов.
Фактор: Для оценки качества модель DeepSeek-V3 генерирует группу из 64 вариантов ответа на один запрос, используя их среднее значение как базовую оценку.
Эффект: Использование GRPO в DeepSeek-V3 позволяет сократить потребление видеопамяти и ускорить процесс обучения без потери качества результатов.
В нашей базе собрано 94 события по теме «DeepSeek». Мы показываем 50 последних из них.
Объединили похожие карточки: DeepSeek; Deepseek-R1-Distilled-Qwen-14B; Deepseek-R1-Distilled-Qwen и другие.