0次浏览 发布时间:2025-04-16 08:24:00
IT之家 4 月 16 日消息,科技媒体 bleepingcomputer 昨日(4 月 15 日)发布博文,报道称 OpenAI 最新发布的 GPT-4.1 系列模型,其性能相比 GPT-4o 虽然实现重大飞跃,但多项跑分未能超越谷歌的 Gemini 系列。
IT之家昨日报道,OpenAI 公司发布 GPT-4.1、GPT-4.1 mini 和 GPT-4.1 nano,官方公布的跑分数据来看,这些模型在编程方面的能力,远超 GPT-4o 及 GPT-4o mini。
例如在 SWE-bench Verified 跑分中,GPT-4o 的得分为 21.4%,GPT-4.5 的得分为 26.6%,而 GPT-4.1 的得分为 54.6%。
尽管性能有较大提升,不过根据多位专家测试,相比较谷歌的 Gemini 系列,GPT-4.1 对比中却显露劣势。
根据 Stagehand(一款生产级浏览器自动化框架)发布的基准数据,Gemini 2.0 Flash 的错误率仅为 6.67%,精确匹配率高达 90%,且价格低廉、速度更快。相比之下,GPT-4.1 的错误率高达 16.67%,成本更是 Gemini 2.0 Flash 的 10 倍以上。
此外,哈佛大学 RNA 科学家 Pierre Bongrand 提供的数据也指出,GPT-4.1 的性价比不及 Gemini 2.0 Flash、Gemini 2.5 Pro 及 DeepSeek 等竞品。
在编码专项测试中,GPT-4.1 同样未能占据上风。Aider Polyglot 的测试结果显示,GPT-4.1 的编码得分仅为 52%,而 Gemini 2.5 则以 73% 的成绩遥遥领先。
值得注意的是,GPT-4.1 被归类为非推理模型(non-reasoning model),但其编码能力仍属行业顶尖。
相关文章
文|洞见新研社游戏行业的“产能天花板”正被AI技术轰然击穿。腾讯、网易、米哈游……所有的游戏厂商都在押注AI,腾讯混元发布混元游戏视觉生成平台,分钟级生成高精度游戏角色;网易《蛋仔派对》借AI实现UGC创作平民化;米哈游新作更以实时多模态对话重构叙事逻辑。无论是腾讯“吉莉”化身玩家AI队友,还是网易
2025-07-28 12:16:00
中国铁塔在WAIC秀AI创新力:自研大模型、数字员工全安排上了
自研经纬大模型、AI智能体应用研发平台、数字员工“塔娃”……在2025世界人工智能大会(WAIC 2025)上,中国铁塔展出了基于共建共享理念打造的数字底座以及丰富的AI行业应用案例。中国铁塔正加大AI等前沿科技创新布局,加快AI应用行业落地。人工智能等新兴技术发展创新,离不开数字基础设施的关键支撑
2025-07-28 09:36:00
2025年1—6月份全国规模以上工业企业利润同比下降1.8%
国家统计局发布的数据显示,1—6月份,全国规模以上工业企业实现利润总额34365.0亿元,同比下降1.8%。
2025-07-27 09:36:00
发展新质生产力是推动高质量发展的内在要求和重要着力点。新质生产力具有高科技、高效能、高质量特征,是符合新发展理念的先进生产力质态。公共数据具有体量大、质量高、覆盖范围广的特点,迎合了数字经济发展的需求,加大其开放能够为市场主体提供丰富的数据要素,对促进新质生产力发展具有重要意义。加大开放:提升智能水
2025-07-16 04:44:00