文章

初探OpenAI GPT-4.1:AI编程能力大增,但谷歌Gemini依然称王

0次浏览     发布时间:2025-04-16 08:24:00    

IT之家 4 月 16 日消息,科技媒体 bleepingcomputer 昨日(4 月 15 日)发布博文,报道称 OpenAI 最新发布的 GPT-4.1 系列模型,其性能相比 GPT-4o 虽然实现重大飞跃,但多项跑分未能超越谷歌的 Gemini 系列。

IT之家昨日报道,OpenAI 公司发布 GPT-4.1、GPT-4.1 mini 和 GPT-4.1 nano,官方公布的跑分数据来看,这些模型在编程方面的能力,远超 GPT-4o 及 GPT-4o mini。

例如在 SWE-bench Verified 跑分中,GPT-4o 的得分为 21.4%,GPT-4.5 的得分为 26.6%,而 GPT-4.1 的得分为 54.6%。

尽管性能有较大提升,不过根据多位专家测试,相比较谷歌的 Gemini 系列,GPT-4.1 对比中却显露劣势。

根据 Stagehand(一款生产级浏览器自动化框架)发布的基准数据,Gemini 2.0 Flash 的错误率仅为 6.67%,精确匹配率高达 90%,且价格低廉、速度更快。相比之下,GPT-4.1 的错误率高达 16.67%,成本更是 Gemini 2.0 Flash 的 10 倍以上。

此外,哈佛大学 RNA 科学家 Pierre Bongrand 提供的数据也指出,GPT-4.1 的性价比不及 Gemini 2.0 Flash、Gemini 2.5 Pro 及 DeepSeek 等竞品。

在编码专项测试中,GPT-4.1 同样未能占据上风。Aider Polyglot 的测试结果显示,GPT-4.1 的编码得分仅为 52%,而 Gemini 2.5 则以 73% 的成绩遥遥领先。

值得注意的是,GPT-4.1 被归类为非推理模型(non-reasoning model),但其编码能力仍属行业顶尖。

相关文章

暴涨96%!一季度“中国游 中国购”持续升温

中共中央政治局4月25日召开会议,分析研究当前经济形势和经济工作,强调“坚定不移办好自己的事,坚定不移扩大高水平对外开放”“以高质量发展的确定性应对外部环境急剧变化的不确定性”,作出一系列重要部署。今年一季度,中国经济交出一份亮丽的开年答卷:5.4%的GDP增长率“超出预期”,各项重要指标数据运行平

2025-04-28 07:20:00

消息称日产本财年末停止东风日产武汉工厂生产:产能利用率不足一成

4月27日消息,日本《读卖新闻》当地时间昨日报道称,日产计划在本财年末(IT之家注:2026年3月底)结束在东风日产武汉工厂的生产作业,这座设计年产能达30 万辆的大型汽车工厂实际产能利用率仅有一成不到。东风日产武汉工厂于2022年启用,生产车型包括ARIYA艾睿雅和X-Trail奇骏,据称 202

2025-04-27 12:24:00

宝山:构筑数据要素创新应用新高地,两大数据创新实验室揭牌

4月25日,宝山区数据创新实验室与上海市绿色低碳(宝山)数据创新实验室正式揭牌。 两个实验室的落地,是宝山区锚定“一地两区”建设战略,以“数据要素高效流通、数据价值有效释放”为主线,加大数据开发利用的创新举措。宝山区数据创新实验室依托南大智慧城九章智算港,线下800平方米的场地配置满足开发、运营、成

2025-04-26 21:26:00

腾讯智影宣布6月30日起改造,期间相关业务暂停服务

IT之家 4 月 26 日消息,在线智能视频创作平台“腾讯智影”本月发布改造调整公告,决定将于 2025 年 6 月 30 日 24 点对智影平台进行改造,期间智影相关业务均会暂停服务。以下是具体时间安排:2025 年 4 月 15 日 11 时:停止新用户注册。2025 年 6 月 30 日 24

2025-04-26 19:55:00

游族网络一季度净利润2470万元,同比增长43.74%

【大河财立方消息】4月25日晚间,游族网络发布了其2025年一季报。报告期内,该公司实现营业收入3.59亿元,同比增长7.29%,实现净利润2470.35万元,同比增长43.74%。同日晚间,该公司还发布了2024年年度报告,实现全年营业收入14.34亿元,其中海外收入为8.63亿元,占比超过60%

2025-04-26 12:30:00