当前位置:首页 > 每日看点 > 正文内容

如何评价谷歌的 Gemini flash 2.5 模型?

卡卷网6个月前 (04-19)每日看点103

短的结论:Google刀法精准,但代价是变慢
基本信息:

  • Gemini 2.5 flash
    • 成本:4.3块每百万
    • 速度:约181字每秒
    • 平均长度:约3180字
    • 平均耗时:16秒

如何评价谷歌的 Gemini flash 2.5 模型?  第1张

  • Gemini 2.5 flash thinking
    • 成本:22块每百万
    • 速度:约190字每秒
    • 平均长度:约16300字
    • 平均耗时:85秒

如何评价谷歌的 Gemini flash 2.5 模型?  第2张


测试方式:参见zhuanlan.zhihu.com/p/32
这次测试基于4月题目,已经增加#34 & #35 2道Hard题,所以所有模型的分数相比3月有变动。


有Gemini 2.5 Pro的珠玉在前,大家对2.5 Flash的期待也水涨船高。在Gemini过往的各种Gemini实验版中,Pro总是轻微胜Flash一筹,这次也不例外。
不一样的是,这次2.5的Pro和Flash都得到了转正待遇,即,有了各自的定价。从价格来看,推理模型刀法精准,贵的模型就是好。基础模型Flash以足够低的价格,几乎判了其他第一梯队推理模型的“死刑”,当然这是夸张的说法,下文分析优劣会详细展开。
不过要注意,Flash前代平均长度仅2400,耗时不到14秒。而新版输出速度差不多,但因为输出更长,回答耗时涨到了16秒。未来或许会失去最快模型的地位。


Flash的基础版和推理版很多方面有相似性,下面合在一起做分析。


优势:

  • 基础模型Flash平均输出达到3180字,个别问题甚至到16000字(9000 token),达到推理模型才有的规模。这使得在一些场景,需要大模型输出尽量详细步骤时,可以使用Flash,而非一些推理模型。
  • 数学计算正确率高,从简单四则运算到复杂函数运算,只要Flash没理解错题,大概率能算对。表现甚至好于部分第二梯队的推理模型。并且,简单的运算问题,Flash、Flash Thinking和2.5 Pro几乎拉不开差距,只在稳定性上2.5 Pro更好。但复杂计算如#22连续计算,#28特殊规则计算,还是2.5Pro > Flash Thinking > Flash。Flash主要丢分在对于小数计算,更倾向于过早的进行舍入,导致精度误差累计。



劣势:

  • Flash和Flash Thinking共性问题是上下文幻觉略重(相对2.5 Pro),如#34地铁换乘,二者都会数错经停站,而2.5Pro表现要好一些。
  • 在人类直觉/找规律类问题上,Flash和Flash Thinking虽然不会暴力求解,但会沿着错误思路走到头,如#32干支纪年,二者都是找错了数学规律,Flash沿着错误规律尝试求解,解到8000多字时发现自己被绕进去了,干脆放弃。
  • Flash和Flash Thinking都有轻微字符幻觉,Flash在要求保留原文的题目上甚至会修改原文,实际使用时要特别留意。Flash Thinking表现好很多。
  • 前面提到,Flash在正确理解题目前提下,计算成功率高。而Flash对部分没有直接思路的计算问题,如#25算24点,表现就显著的差,不但算错,还在字符幻觉的公共作用下,无中生有的造出新数字。Flash Thinking则基本无此问题。
  • Flash Thinking在面对多重条件时,容易“慌乱”,表现是推理中途搞错条件,然后错到底。如#1猜单词,#20桌游模拟,#30日记整理均如此。表现甚至略差于Flash。
  • Flash有少量问题会陷入死循环,用满max token。



赛博史官曰:
Google这套组合拳打得好,把基础模型的成本降下去,速度提上来,进而给推理模型留够工程策略空间。不过随着最近各家都大量使用合成数据,蒸馏推理模型数据,导致基础模型的输出长度也越来越长。Flash也从前代2400涨到了3180,30%的输出提升换来20%的智力提升。这样下去,恐怕很快又需要一个小模型对基础模型输出再做一次汇总了。
对海外用户而言,Flash Thinking的单价虽然低,但使用成本并没有比o4 mini high便宜多少,更是不如medium档位的o3 mini/o4 mini。推理耗时也不占优。对国内用户而言,这个问题要小一些,早2天发布的豆包推理版本用一半成本做到相同性能,而且人家还有降价空间。何况豆包的稳定性甚至更好。

扫描二维码推送至手机访问。

版权声明:本文由卡卷网发布,如需转载请注明出处。

本文链接:https://www.kajuan.net/ttnews/2025/04/12684.html

分享给朋友:

相关文章

支付宝碰一碰市场如何?

支付宝碰一碰市场如何?

今年,支付宝又整了新的大活,即无须扫码即能完成支付操作的“支付宝碰一碰”正式登场。下面就来给大家分析分析,这是个什么情况,为什么都在说能赚钱。支付宝碰一下怎么赚钱的?都有谁能赚到这份钱?1.支付宝碰一下原理支付宝碰一下的本质依旧是“条码支付...

感觉手机配置都差不多,为什么有的手机能卖2k-3k,而有的手机却能卖到6k-8k?

感觉手机配置都差不多,为什么有的手机能卖2k-3k,而有的手机却能卖到6k-8k?

与所有的商品一样,手机的价格,也是由它的成本所决定的。虽然看起来3000元的手机和6000的手机配置差不多,甚至处理器都可能是同一个,但在很多大家容易忽略的地方,决定了两者价格的不同:例如手机的外观,塑料的机身,与素皮机身和玻璃机身就完全不...

报名的网课分期付款怎么退?

你在你分期付款的订单下面有客服电话,直接打电话描述一下你的问题,你可以告诉他你是被恶意绑定的,在不了解有退学条件这一说的情况下报的课程,可能遇到消费者诈骗了,不承认有退学金,说是霸王条款,诈骗消费者,你若分期了先把自动续费关了,别让自己个人...

都是前端框架,为什么用 React 的人会有优越感?

都是前端框架,为什么用 React 的人会有优越感?

上家公司一直搞react,最近第一次写个vue3项目。老板朋友来了看了下页面说:这用vue写的吧。我:是...老板朋友:一看就知道是vue做的。这tm你看一眼页面就知道用的啥框架?这感觉就是,我一直用苹果,偶尔用了下华为打电话,有个人离老远...

有哪些是你用上了mac才知道的事?

用上了高端的Mac(已退货)才知道:原来文件夹里面的文件,你看到是8个,其实可能有12个。其中3个图标重叠在一起了,另外一个被拖动到屏幕外面了。用上了高端的Mac(已退货)才知道:原来鼠标灵敏度有问题是因为系统内置了鼠标加速度,只能用控制台...

如何看待台积电,三星相继停供大陆7nm及更先进芯片?

在这个事出来之前,我就看到过一个说法,两家Foundry可以在中东建厂,让中东的Fab去干“脏活”。本质上是国内企业搞几个中东的代理人,装作是中东的初创Fabless企业去下单,人家Foundry大概率睁一只眼闭一只眼,只管数钱。然而,紧接...

发表评论

访客

看不清,换一张

◎欢迎参与讨论,请在这里发表您的看法和观点。