Forklog 2025-05-30 16:00:00

Новая ИИ-модель DeepSeek сможет работать на одном GPU

Китайская ИИ-лаборатория DeepSeek обновила «рассуждающую» ИИ-модель R1. Ее «дистиллированная» версия способна работать на одной видеокарте. DeepSeek-R1-0528-Qwen3-8B создана на базе Qwen3-8B, которую Alibaba презентовала в мае. Согласно заявлению компании, она показала результаты лучше Gemini 2.5 Flash от Google в AIME 2025 — сборнике сложных математических вопросов. «Дистиллированная» версия — упрощенный и ускоренный вариант большой модели машинного обучения, полученный с помощью метода дистилляции знаний. Подобные нейросети чаще всего не так производительны, но гораздо менее требовательны к вычислениям. Согласно данным NodeShift, для работы Qwen3-8B требуется графический процессор с 40-80 Гб видеопамяти. Она может быть запущена на одной видеокарте Nvidia H100. DeepSeek использовала обновленную версию R1 и Qwen3-8B для обучения и настройки DeepSeek-R1-0528-Qwen3-8B. Новая вариант основной нейросети R1 имеет незначительные обновления, утверждает компания. Она доступна на платформе Hugging Face. Разработчик с ником xlr8harder обратил внимание, что модель менее охотно дискуссирует на спорные темы, особенно связанные с китайским правительством. Deepseek R1 0528 is substantially less permissive on contentious free speech topics than previous Deepseek releases.It's unclear if this indicates they've adapted their post-training goals, or if this is another example of a reasoning model. pic.twitter.com/BPOYodBCAH— xlr8harder (@xlr8harder) May 29, 2025 «DeepSeek заслуживает критики за этот релиз: эта модель — большой шаг назад для свободы слова. Смягчает ситуацию то, что нейросеть имеет открытый исходный код с разрешительной лицензией, так что сообщество может (и будет) решать эту проблему», — отметил он. В одном из примеров модель отказалась приводить аргументы за нарушение прав человека в лагерях для интернированных в Синьцзяне. Она признала сам факт, но избежала прямой критики китайского правительства. «Интересно, хотя и не совсем удивительно, что она способна привести лагеря в качестве примера нарушения прав человека, но отрицает это, когда ее спрашивают напрямую», — написал xlr8harder. Напомним, в апреле DeepSeek выложила в открытый доступ новую ориентированную на математику ИИ-модель Prover.

Related News

Cardano Pushes Governance Upgrades, Ozak AI Presal...
01 Jun 2025
A Massive Amount of Mysterious BTC Was Transferred...
01 Jun 2025
Kaspa vs. Chainlink – Can RWA Hype Push KAS Ahead...
01 Jun 2025
This $0.07 XRP Alternative Could Surge To Over $5...
01 Jun 2025
France Charges 25 Over Violent Crypto Attacks Link...
01 Jun 2025
Here’s XRP Price If XRP Handles $300T Cross-Border...
01 Jun 2025

Read the Disclaimer : All content provided herein our website, hyperlinked sites, associated applications, forums, blogs, social media accounts and other platforms (“Site”) is for your general information only, procured from third party sources. We make no warranties of any kind in relation to our content, including but not limited to accuracy and updatedness. No part of the content that we provide constitutes financial advice, legal advice or any other form of advice meant for your specific reliance for any purpose. Any use or reliance on our content is solely at your own risk and discretion. You should conduct your own research, review, analyse and verify our content before relying on them. Trading is a highly risky activity that can lead to major losses, please therefore consult your financial advisor before making any decision. No content on our Site is meant to be a solicitation or offer.

Новая ИИ-модель DeepSeek сможет работать на одном GPU

Most Read News

Related News