Forklog 2025-05-30 16:00:00

Новая ИИ-модель DeepSeek сможет работать на одном GPU

Китайская ИИ-лаборатория DeepSeek обновила «рассуждающую» ИИ-модель R1. Ее «дистиллированная» версия способна работать на одной видеокарте. DeepSeek-R1-0528-Qwen3-8B создана на базе Qwen3-8B, которую Alibaba презентовала в мае. Согласно заявлению компании, она показала результаты лучше Gemini 2.5 Flash от Google в AIME 2025 — сборнике сложных математических вопросов. «Дистиллированная» версия — упрощенный и ускоренный вариант большой модели машинного обучения, полученный с помощью метода дистилляции знаний. Подобные нейросети чаще всего не так производительны, но гораздо менее требовательны к вычислениям. Согласно данным NodeShift, для работы Qwen3-8B требуется графический процессор с 40-80 Гб видеопамяти. Она может быть запущена на одной видеокарте Nvidia H100. DeepSeek использовала обновленную версию R1 и Qwen3-8B для обучения и настройки DeepSeek-R1-0528-Qwen3-8B. Новая вариант основной нейросети R1 имеет незначительные обновления, утверждает компания. Она доступна на платформе Hugging Face. Разработчик с ником xlr8harder обратил внимание, что модель менее охотно дискуссирует на спорные темы, особенно связанные с китайским правительством. Deepseek R1 0528 is substantially less permissive on contentious free speech topics than previous Deepseek releases.It's unclear if this indicates they've adapted their post-training goals, or if this is another example of a reasoning model. pic.twitter.com/BPOYodBCAH— xlr8harder (@xlr8harder) May 29, 2025 «DeepSeek заслуживает критики за этот релиз: эта модель — большой шаг назад для свободы слова. Смягчает ситуацию то, что нейросеть имеет открытый исходный код с разрешительной лицензией, так что сообщество может (и будет) решать эту проблему», — отметил он. В одном из примеров модель отказалась приводить аргументы за нарушение прав человека в лагерях для интернированных в Синьцзяне. Она признала сам факт, но избежала прямой критики китайского правительства. «Интересно, хотя и не совсем удивительно, что она способна привести лагеря в качестве примера нарушения прав человека, но отрицает это, когда ее спрашивают напрямую», — написал xlr8harder. Напомним, в апреле DeepSeek выложила в открытый доступ новую ориентированную на математику ИИ-модель Prover.

Наиболее читаемые новости

Savvy Investor Nets $237K Profit Trading MILK...
2025-06-03
Austin King Explains Why the Next 2 Years Are...
2025-06-03
10,710,000,000 In Dogecoin as Open Interest R...
2025-06-03
Justin Sun and TRON DAO’s Role at Bitcoin Veg...
2025-06-03
Ethereum ETH Price Prediction 2025, 2026 – 20...
2025-06-03
Solana Memecoins WIF and POPCAT See Overnight...
2025-06-03
Netizens wary of Trump's new AI regulation pr...
2025-06-03
Stablecoins Empower European Markets with Acc...
2025-06-03

Связанные новости

Прочтите Отказ от ответственности : Весь контент, представленный на нашем сайте, гиперссылки, связанные приложения, форумы, блоги, учетные записи социальных сетей и другие платформы («Сайт») предназначен только для вашей общей информации, приобретенной у сторонних источников. Мы не предоставляем никаких гарантий в отношении нашего контента, включая, но не ограничиваясь, точность и обновление. Никакая часть содержания, которое мы предоставляем, представляет собой финансовый совет, юридическую консультацию или любую другую форму совета, предназначенную для вашей конкретной опоры для любых целей. Любое использование или доверие к нашему контенту осуществляется исключительно на свой страх и риск. Вы должны провести собственное исследование, просмотреть, проанализировать и проверить наш контент, прежде чем полагаться на них. Торговля - очень рискованная деятельность, которая может привести к серьезным потерям, поэтому проконсультируйтесь с вашим финансовым консультантом, прежде чем принимать какие-либо решения. Никакое содержание на нашем Сайте не предназначено для запроса или предложения