公众号手机端

智谱GLM-5.3大模型发布:开源中最强、编程/智能体性能接近Fable 5

zhiyongz 4小时前 阅读数 17 #人工智能
文章标签 智谱GLM-5.3大模型
快科技8月14日消息,智谱创始人几个小时前才说GLM-5.3很快发布,没想到中午就发了,相比当前的GLM-5.2提升50%,是开源最强的,编程与智能体性能接近Fable 5。与之前传闻的不同,GLM-5.3跟GLM-5.2基座模型还是一样的7400多亿参数量,升级到万亿参数是没有的,有可能是留给GLM-5.5了,但这也没有妨碍GLM-5.3通过后训练来提升性能水平。根据智谱说法,在多项主流基准测试中GLM-5.3是当前排名最高的开源模型,编程与智能体能力接近Claude Fable 5,编程体感超过其他国产模型。
在衡量模型于真实终端环境中完成复杂任务的Terminal-Bench 3.0上,GLM-5.3得分从4.6提升至28.3;在聚焦长程软件工程与持续代码修改能力的DeepSWE v1.1上,得分从46.2提升至66.9;在覆盖多类真实专业场景、强调跨工具协作与长程任务的Agents' Last Exam上,得分从23.8提升至28.5。
在覆盖44种职业、考察真实高价值知识工作的GDPval-AA v2中得分1769,展现基于编程能力涌现的专业任务执行能力。整体来看,GLM-5.3在复杂软件工程、终端操作和更广泛的真实世界 Agent任务上均取得非常显著的进步。
智谱GLM-5.3大模型发布:开源中最强、编程/智能体性能接近Fable 5 智谱GLM-5.3大模型 第1张
智谱GLM-5.3大模型发布:开源中最强、编程/智能体性能接近Fable 5
自研的Z.ai Code Bench评估模型在真实编程场景中的综合体感。模型会被置于复杂的本地开发环境,并在不同思考档位下执行端到端任务,更接近开发者实际使用Coding Agent时的体验。测试结果显示,GLM-5.3在效果和Token利用率之间取得了更好的平衡。在High档位下,GLM-5.3达到31.4%的准确率,超过Claude Opus 4.8最高档位的29.5%,每项任务平均输出约5万tokens,而Opus 4.8需要约12万tokens,意味着GLM-5.3可以用更短的执行路径完成任务。
智谱GLM-5.3大模型发布:开源中最强、编程/智能体性能接近Fable 5 智谱GLM-5.3大模型 第2张
智谱GLM-5.3大模型发布:开源中最强、编程/智能体性能接近Fable 5
GLM-5.3即日起上线智谱官方编程工具ZCode、效率工具AutoClaw,上线GLM Coding Plan全量用户及开放订阅。TraeWork/TraeCode/扣子、WorkBuddy/CodeBuddy、Qoder/QwenWork、CatPaw、JoyCode、OpenCode等编码平台开放抢先体验。API很快上线,完整模型权重将在两周内开源,此前需完成必要的安全加固,尽可能限制其潜在攻击能力,保留其防御价值。
今天13:00,GLM Coding Plan全员额度重置,所有用户后台「用量统计」可见使用额度回满。更详细的情况可以参考官方的发布通稿
【本文结束】出处:快科技



版权声明

本站所有文章来源于本站原创或网络,如有侵权请联系删除。文章观点并不代表本站观点,请网友自行判断,如涉及投资、理财请谨慎应对!

发表评论:

◎欢迎参与讨论,请在这里发表您的看法、交流您的观点。

热门