DeepSeek最近发布了其AI模型的新升级版本,并根据早期测试,它有可能使Chatgpt和Gemini的制造商感到不安。该模型称为DeepSeek-R1-0528,已通过基准测试和早期测试展示了中国生成AI模型的正面情况。 R1-0528型号超过了Gemini Chatbot的免费版本,并关闭了Openai的O3型号。
但是,Deepseek工程师的袖子又有另一个王牌。遵循他们最新的全面模型,该团队提出了同一版本的轻量级版本。 TechCrunch报告称,“蒸馏”版本称为DeepSeek-R1-0528-QWEN3-8B,声称可以提供主流模型的性能,同时需要较少的资源。
轻巧的版本基于阿里巴巴的QWEN3-8B型号,在AIME 2025测试中,它的性能优于Google Gemini 2.5 Flash模型,求解了比Google免费模型更快的所有具有挑战性的数学查询。
不仅Google,而且DeepSeek-R1-0528-QWEN3-8B还设法匹配了Microsoft的Phi 4 Challioning Plus HMMT上的型号。
较小资源的匹配性能
DeepSeek-R1-0528-QWEN3-8B模型更令人惊讶的是其资源要求。全尺寸的DeepSeek-R1-0528模型必须依靠12个GPU,每个GPU至少具有80GB的RAM。 Distiled DeepSeek-R1-0528-QWEN3-8B型号的性能可能不如成熟型号,但仅需要一个GPU即可运行,而RAM也低至40GB。
一个寻求较少资源的AI模型,同时提供与竞争能力一样多的能力,这对于那些为大约十几个80GB GPU而寻求更多绩效的人来说,这是一个很好的选择。 DeepSeek指出,DeepSeek-R1-0528-QWEN3-8B模型“适合于推理模型的学术研究和专注于小规模模型的工业发展”。
与OpenAI和Google型号不同,DeepSeek-R1-0528-QWEN3-8B可根据MIT许可获得。因此,它可以在商业上使用而无需限制。