DeepSeek V4-Flash: массовый переход на дешевый ИИ и три скрытых риска для бизнеса
Модели DeepSeek обрушили стоимость вычислений в сотни раз, вынудив бизнес перестроить бюджеты на гибридную схему с дешевыми китайскими решениями. За этой экономией скрываются критические риски: от игнорирования прямых команд агентами до юридических войн с западными гигантами и угроз безопасности данных. / Страница 4
Читать полностью
Календарь упоминаний. Страница 4:
DeepSeek развивает архитектуру моделей в условиях санкций и дефицита чипов
Суть: DeepSeek, как один из ключевых китайских разработчиков фундаментальных моделей, вынужден искать обходные пути развития из-за ограничений на экспорт чипов из США и нехватки вычислительных ресурсов.
Фактор: Невозможность реализации стратегии масштабных инвестиций и наращивания мощностей заставляет DeepSeek смещать акцент на сжатие моделей и оптимизацию инженерной эффективности.
Тренд: Компания ориентируется на концепцию бережливых инноваций, стимулируя поиск прорывных решений в области открытого программного обеспечения и эффективности развертывания моделей.
DeepSeek разрабатывает собственный чип для вывода ИИ и планирует привлечь $7 млрд
Суть: Китайский стартап DeepSeek совершает стратегический разворот от разработки ПО к созданию специализированного аппаратного обеспечения для эксплуатации нейросетей.
Событие: Компания начала тайную разработку чипа для вывода результатов (inference) с целью снижения зависимости от поставщиков Nvidia и Huawei.
Связь: Переход DeepSeek на собственные процессоры спровоцировал снижение акций Nvidia на 1,6% в предрыночной торговле из-за опасений инвесторов.
Анонс: Стартап готовится к первому раунду привлечения инвестиций на сумму около $7 млрд при оценке компании от $52 до $59 млрд.
Риск: Эксперты указывают на сложность выхода DeepSeek на глобальный рынок чипов из-за отсутствия доступа к передовым производственным мощностям.
DeepSeek применил дистилляцию для переноса навыков рассуждения на компактные модели
Суть: DeepSeek использовал метод дистилляции знаний для переноса способностей модели DeepSeek-R1 на более компактные версии, что позволило решить проблему высокой стоимости вычислений.
Событие: DeepSeek создал модель DeepSeek-R1-Distill-Qwen-7B, которая в задачах логического вывода показала результаты, превосходящие прямое обучение с подкреплением и более крупные аналоги.
Связь: Успешное применение дистилляции компанией DeepSeek сделало технологию востребованной и привлекло внимание к юридическим рискам использования выходов проприетарных моделей без разрешения.
Риск: Случай с DeepSeek и OpenAI показал, что применение дистилляции может стать предметом судебных споров, если для обучения используются данные конкурентов без согласования.
NeMo AutoModel обеспечивает ускоренное дообучение архитектуры DeepSeek V3
Суть: Библиотека NVIDIA NeMo AutoModel предоставляет заранее настроенные реализации для архитектуры DeepSeek V3, позволяя ускорить процесс дообучения без переписывания кода.
Эффект: Использование инструмента обеспечивает рост пропускной способности обучения в 3,4–3,7 раза и снижение потребления видеопамяти GPU на 29–32% по сравнению с нативной реализацией.
Фактор: Для моделей типа DeepSeek V3 библиотека применяет специализированные оптимизации, включая экспертный параллелизм и технологию DeepEP, объединяющую коммуникацию и вычисления.
Алгоритм GRPO в DeepSeek-R1 снижает требования к видеопамяти при обучении
Суть: В модели DeepSeek-R1 применен алгоритм GRPO, который устраняет необходимость в отдельной нейросети-критике для оценки состояния.
Фактор: Вместо сложной оценки модель генерирует группу из 64 вариантов ответа, используя среднее значение по группе для расчета преимущества.
Эффект: Данная архитектура позволяет сократить потребление видеопамяти и ускорить процесс обучения без потери качества результатов.
В нашей базе собрано 99 событий по теме «DeepSeek». Мы показываем 50 последних из них.
Объединили похожие карточки: DeepSeek; Deepseek-R1-Distilled-Qwen-14B; Deepseek-R1-Distilled-Qwen и другие.