阿里Qwen发布320亿参数QwQ-32B大模型
创始人
2025-03-06 12:40:31
0

2025-03-06 09:42:19 作者:狼叫兽

3月6日,阿里Qwen团队正式对外发布了其最新的研究成果——QwQ-32B大语言模型。这款模型拥有320亿参数,在性能上能够与参数量高达6710亿的DeepSeek-R1(其中370亿参数被激活)相媲美。

尽管QwQ-32B的参数量仅为DeepSeek-R1的大约1/21,但通过强化学习技术,该模型成功实现了性能上的显著提升。此外,阿里在这款推理模型中还集成了与Agent相关的能力,使其不仅能够使用工具,还能进行批判性思考,并根据环境反馈动态调整推理过程。

QwQ-32B在多项基准测试中接受了全面评估,涉及数学推理、编程能力和通用能力等多个领域。在数学能力测试AIME24评测集中,以及用于评估代码能力的LiveCodeBench测试中,QwQ-32B的表现与DeepSeek-R1相当,并且大幅优于o1-mini和相同规模的R1蒸馏模型。

同时,在由多位知名研究者主导的多个权威评测榜单中,QwQ-32B也取得了优异成绩。例如,在被称为“最难LLMs评测榜”的LiveBench、用于评估指令遵循能力的IFEval评测集,以及针对函数或工具调用准确性测试的BFCL中,QwQ-32B的得分均超过了DeepSeek-R1。

目前,QwQ-32B已经在Hugging Face和ModelScope平台开源,用户还可以通过Qwen Chat直接体验这一先进模型。

相关内容

热门资讯

数据要素×优秀案例集——数据产... 当前,石化化工、有色金属等原材料行业普遍面临设备运维低效、工艺知识流失、安全环保管控压力大、数据利用...
三星Galaxy A27规格曝... IT之家 5 月 26 日消息,据科技媒体 SammyGuru 今天报道,三星新款中端机 Galax...
华为申请元数据访问方法专利,提... 国家知识产权局信息显示,华为技术有限公司申请一项名为“一种元数据访问方法、存储器以及设备”的专利,公...
第三方光伏组件湿热老化后性能测... 第三方光伏组件湿热老化后性能测试实验报告 一、检测范围 本测试实验主要针对晶体硅光伏组件,在模拟...
2026世界无人机大会:专家建... 中新网北京5月26日电 (张素 毛炜达)发布《2026县域低空经济发展报告》《低空经济法治与管理实践...
被问买不买小米汽车 武契奇幽默... 快科技5月26日消息,今日,正在对华进行国事访问的塞尔维亚总统武契奇到访小米汽车工厂,亲自坐进驾驶舱...
告别只靠自研 三星DX部门6月... 【CNMO科技消息】近日,三星电子宣布,将于6月在设备体验(DX)部门正式引入外部生成式AI服务,纳...
推动“机器人+”场景应用跨区域... 京津冀七家园区签署“机器人+”产业园合作协议 推动“机器人+”场景应用跨区域试点示范 近日,京津冀7...
实拍腾讯新总部「企鹅岛」:别人... 腾讯在大铲湾建新总部园区,也就是大家口口相传的“企鹅岛”,早就不是新闻了。 但应该少有人知,这个新总...
荣耀600系列发布会现场AI3... 京东外卖宣布推出重新定义外卖复购效率的创新功能:AI一键复购外卖,在2026年5月25日晚荣耀600...