文章

初探OpenAI GPT-4.1:AI编程能力大增,但谷歌Gemini依然称王

0次浏览     发布时间:2025-04-16 08:24:00    

IT之家 4 月 16 日消息,科技媒体 bleepingcomputer 昨日(4 月 15 日)发布博文,报道称 OpenAI 最新发布的 GPT-4.1 系列模型,其性能相比 GPT-4o 虽然实现重大飞跃,但多项跑分未能超越谷歌的 Gemini 系列。

IT之家昨日报道,OpenAI 公司发布 GPT-4.1、GPT-4.1 mini 和 GPT-4.1 nano,官方公布的跑分数据来看,这些模型在编程方面的能力,远超 GPT-4o 及 GPT-4o mini。

例如在 SWE-bench Verified 跑分中,GPT-4o 的得分为 21.4%,GPT-4.5 的得分为 26.6%,而 GPT-4.1 的得分为 54.6%。

尽管性能有较大提升,不过根据多位专家测试,相比较谷歌的 Gemini 系列,GPT-4.1 对比中却显露劣势。

根据 Stagehand(一款生产级浏览器自动化框架)发布的基准数据,Gemini 2.0 Flash 的错误率仅为 6.67%,精确匹配率高达 90%,且价格低廉、速度更快。相比之下,GPT-4.1 的错误率高达 16.67%,成本更是 Gemini 2.0 Flash 的 10 倍以上。

此外,哈佛大学 RNA 科学家 Pierre Bongrand 提供的数据也指出,GPT-4.1 的性价比不及 Gemini 2.0 Flash、Gemini 2.5 Pro 及 DeepSeek 等竞品。

在编码专项测试中,GPT-4.1 同样未能占据上风。Aider Polyglot 的测试结果显示,GPT-4.1 的编码得分仅为 52%,而 Gemini 2.5 则以 73% 的成绩遥遥领先。

值得注意的是,GPT-4.1 被归类为非推理模型(non-reasoning model),但其编码能力仍属行业顶尖。

相关文章

日本初创公司打造袖珍电动汽车Mibot:长2.5米,续航100公里

IT之家 6 月 9 日消息,据外媒 Carscoops 今日报道,日本一家初创公司 KG Motors 推出了一款袖珍级纯电动汽车 Mibot,其车身尺寸小于日本流行的 K-car“轻自动车”,只能容纳一名驾驶者。但有趣的是,该车可以整体塞进一台丰田海狮的车厢内。KG Motors 创始人楠一成表

2025-06-09 12:36:00

《碟中谍8》:AI时代的套路与情怀

电影《碟中谍8:最终清算》(2025年)剧照。资料图单元剧式的系列影视作品,随着系列的发展,很多都会逐渐脱离现实世界,形成一套属于自己的叙事模式与行为逻辑。而这种模式在系列后期,也会在很大程度上取代故事,成为系列的主体。例如经典美剧《老友记》一开始只是六个纽约年轻人之间的故事。到后来,罗斯的书呆子、

2025-06-06 21:01:00

日本2024年出生新生儿数首次跌破70万

观点网讯:6月4日,日本厚生劳动省人口动态数据显示,2024年在日本出生新生儿数为68.6061万人,比上一年下降5.7%,为连续9年下降。据悉,这也是自1899年有记录以来,日本的年度出生人口首次跌破70万。日本国立社会保障与人口问题研究所2023年公布的预测显示,日本2024年的出生人口为75.

2025-06-05 00:00:00

最新成果!水利标准AI大模型正式发布

来源:央视网央视网消息:据中国水利微信公众号消息,近日,由水利部国科司组织中国水科院自主研发的基于多源语料的“水利标准AI大模型”正式发布,并在水利技术标准专题评估工作中实际应用。该模型基于中国水科院“SkyLIM”体系,采用“海量知识库+DeepSeek/Qwen双模型+标准服务”技术架构,深度集

2025-06-03 11:10:00

不听人类指挥 OpenAI模型拒绝关闭

当地时间5月25日,英国《每日电讯报》报道,美国开放人工智能研究中心(OpenAI)公司新款人工智能(AI)模型o3不听人类指令,拒绝自我关闭。报道说,人类专家在测试中给o3下达明确指令,但o3篡改计算机代码以避免自动关闭。o3模型是OpenAI“推理模型”系列的最新版本,旨在为ChatGPT提供更

2025-05-26 18:01:00