当前位置:首页 > 每日看点

如何评价谷歌的 Gemini flash 2.5 模型?

卡卷网1年前 (2025-04-19)每日看点224

短的结论:Google刀法精准,但代价是变慢
基本信息:

  • Gemini 2.5 flash
    • 成本:4.3块每百万
    • 速度:约181字每秒
    • 平均长度:约3180字
    • 平均耗时:16秒

如何评价谷歌的 Gemini flash 2.5 模型?  第1张

  • Gemini 2.5 flash thinking
    • 成本:22块每百万
    • 速度:约190字每秒
    • 平均长度:约16300字
    • 平均耗时:85秒

如何评价谷歌的 Gemini flash 2.5 模型?  第2张


测试方式:参见zhuanlan.zhihu.com/p/32
这次测试基于4月题目,已经增加#34 & #35 2道Hard题,所以所有模型的分数相比3月有变动。


有Gemini 2.5 Pro的珠玉在前,大家对2.5 Flash的期待也水涨船高。在Gemini过往的各种Gemini实验版中,Pro总是轻微胜Flash一筹,这次也不例外。
不一样的是,这次2.5的Pro和Flash都得到了转正待遇,即,有了各自的定价。从价格来看,推理模型刀法精准,贵的模型就是好。基础模型Flash以足够低的价格,几乎判了其他第一梯队推理模型的“死刑”,当然这是夸张的说法,下文分析优劣会详细展开。
不过要注意,Flash前代平均长度仅2400,耗时不到14秒。而新版输出速度差不多,但因为输出更长,回答耗时涨到了16秒。未来或许会失去最快模型的地位。


Flash的基础版和推理版很多方面有相似性,下面合在一起做分析。


优势:

  • 基础模型Flash平均输出达到3180字,个别问题甚至到16000字(9000 token),达到推理模型才有的规模。这使得在一些场景,需要大模型输出尽量详细步骤时,可以使用Flash,而非一些推理模型。
  • 数学计算正确率高,从简单四则运算到复杂函数运算,只要Flash没理解错题,大概率能算对。表现甚至好于部分第二梯队的推理模型。并且,简单的运算问题,Flash、Flash Thinking和2.5 Pro几乎拉不开差距,只在稳定性上2.5 Pro更好。但复杂计算如#22连续计算,#28特殊规则计算,还是2.5Pro > Flash Thinking > Flash。Flash主要丢分在对于小数计算,更倾向于过早的进行舍入,导致精度误差累计。



劣势:

  • Flash和Flash Thinking共性问题是上下文幻觉略重(相对2.5 Pro),如#34地铁换乘,二者都会数错经停站,而2.5Pro表现要好一些。
  • 在人类直觉/找规律类问题上,Flash和Flash Thinking虽然不会暴力求解,但会沿着错误思路走到头,如#32干支纪年,二者都是找错了数学规律,Flash沿着错误规律尝试求解,解到8000多字时发现自己被绕进去了,干脆放弃。
  • Flash和Flash Thinking都有轻微字符幻觉,Flash在要求保留原文的题目上甚至会修改原文,实际使用时要特别留意。Flash Thinking表现好很多。
  • 前面提到,Flash在正确理解题目前提下,计算成功率高。而Flash对部分没有直接思路的计算问题,如#25算24点,表现就显著的差,不但算错,还在字符幻觉的公共作用下,无中生有的造出新数字。Flash Thinking则基本无此问题。
  • Flash Thinking在面对多重条件时,容易“慌乱”,表现是推理中途搞错条件,然后错到底。如#1猜单词,#20桌游模拟,#30日记整理均如此。表现甚至略差于Flash。
  • Flash有少量问题会陷入死循环,用满max token。



赛博史官曰:
Google这套组合拳打得好,把基础模型的成本降下去,速度提上来,进而给推理模型留够工程策略空间。不过随着最近各家都大量使用合成数据,蒸馏推理模型数据,导致基础模型的输出长度也越来越长。Flash也从前代2400涨到了3180,30%的输出提升换来20%的智力提升。这样下去,恐怕很快又需要一个小模型对基础模型输出再做一次汇总了。
对海外用户而言,Flash Thinking的单价虽然低,但使用成本并没有比o4 mini high便宜多少,更是不如medium档位的o3 mini/o4 mini。推理耗时也不占优。对国内用户而言,这个问题要小一些,早2天发布的豆包推理版本用一半成本做到相同性能,而且人家还有降价空间。何况豆包的稳定性甚至更好。

扫描二维码推送至手机访问。

版权声明:本文由卡卷网发布,如需转载请注明出处。

本文链接:https://www.kajuan.net/ttnews/2025/04/12684.html

分享给朋友:

相关文章

你捡过最大的漏是什么?

你捡过最大的漏是什么?

买了套二手房,软磨硬泡便宜了1个w 结果就是一屋子狼藉 原业主说反正你们要重新装修 就不收拾了 等完了你们一起收拾掉吧 落了很多柜子 电器是啥的 今天打开卧室柜子一看… 现在是去存钱的路上 有朋友知道这样存钱银行会给发大米跟油吗…

你每天用来涨知识的手机应用程序有哪些?

你每天用来涨知识的手机应用程序有哪些?

经过深度使用和测评, 从100个APP中选出的这35个超实用的app,每一个都是最硬核最有料的涨知识神器!每天打开看看,能让你提神醒脑,眼界大开,成为朋友聚会上的话题王者! 先放上全部APP目录,有新闻资讯类、英语学习类、读书类、影视类…

中国芯片产量达1399亿颗,这意味着什么?

美国并不是没有明白人,只是特朗普不懂芯片产业的情况,冒冒失失在ZZ正确下,开启了对中国芯片的掐脖子,结果没掐死,反而让人练出了铁肺。 芯片是所有科技产业的上游,美国原本在上游呆得很舒服,靠英伟达、AMD、德州仪器、高通等这些几十年霸主地位的…

数字人民币为什么又不火了?

我完全不懂行。 我一开始以为,数字人民币,是对我银行里的每一分钱,都赋予一个独一无二的数字编码。 我要用一块钱买矿泉水,它就从我的存款中随机选取一百个一分钱,组合成一块钱,支付给商家。 我花一百块钱吃饭,它就随机选取一万个一分钱,组合成一百…

如何判断 Java 工程师的基础知识是否扎实?

我来给你出几道大题,能答对70%,你就算基础扎实了。 第一部分 Java基础(27)1. 程序本质:代码是如何被执行的?CPU、操作系统、虚拟机各司何职?2. 基础语法:从CPU角度看变量、数组、类型、运算、跳转、函数等语法3. 引用类型:…

有没有高手指点一下Google做SEO现在的技巧啊?心好累。

有没有高手指点一下Google做SEO现在的技巧啊?心好累。

搜索引擎优化 (SEO) 的目标是让 Google 在用户输入相关搜索查询时提供您的网页链接。 虽然没有固定的蓝图可以保证您获得最高排名,但有几种 SEO 最佳实践(您可以将其视为 SEO 规则)可以增加您在非付费结果中获得良好排名的机会。…

发表评论

访客

看不清,换一张

◎欢迎参与讨论,请在这里发表您的看法和观点。