设为首页收藏本站

爱吱声

 找回密码
 注册
搜索
查看: 2075|回复: 5
打印 上一主题 下一主题

[科技前沿] 中外大模型数学能力比拼

[复制链接]
  • TA的每日心情
    奋斗
    2021-4-20 05:43
  • 签到天数: 300 天

    [LV.8]合体

    跳转到指定楼层
    楼主
     楼主| 发表于 2025-1-26 17:34:23 | 只看该作者 回帖奖励 |倒序浏览 |阅读模式
    本帖最后由 可梦之 于 2025-1-26 17:57 编辑
    8 ], }7 s1 B/ h- \1 N+ y3 f! `
    8 e' f" m9 b  V0 w" V8 H遇到一个数学问题,懒得推导了。习惯性让GPT推一下。
    : L  o6 m% C7 Q  o
    8 p( D2 P2 O8 A  A4 Q- s+ J- y最开始问题给错了,然后纠正了一下,貌似GPT就鬼打墙出不来了。给的答案也不对。
    , _6 a& ^* b% v. A4 ~+ B
    $ \' [3 m7 @* g
    % F$ L0 k- b2 S$ r$ V3 `: \* R# h可能受上下文影响。那重开一个对话,结果还是不对。要么说没有解5 Q3 V: ]. h& Z! u% V: z0 B

    / k+ R: ^( C1 F1 s! m% X+ P6 z/ L; f& S1 {9 Q
    0 c# P/ y) @2 D2 B% H

    . Y# w) j; Q% r, r9 q
    8 s; v; _9 j( I% b0 {要么继续胡说八道。% [- j# @8 p4 ]; |: ~; v3 a
    6 I3 M( t0 n" ]# Y+ i# _  D
    / N& n( m5 O* \" |+ C
    抱着试试看的态度,把同样的问题扔给了豆包和deepseek。
    + ~2 Y. E# Z3 r: F. E; ?& k& ?! c" ?. C3 n; ?1 \/ q
    deepseek速度快,结果也对,但是过程是不对的。) M5 c4 l& ]* [" k  F! d
    # s9 T' g" T4 u$ ]* ^
    2 x6 y/ Q9 e* J& H
    豆包过程比较绕,但是基本正确,结果也是对的。
    5 s' q% t. ~2 `( H' ~7 }) ~% O; J- A8 [: H' ^; B
      n8 w4 ~' G1 x# v
    当然,都不如人推导的哈。2 X, y7 d9 m1 b& S
    " K' I& u3 R( H# V
    5 f0 X7 M8 Q- Y% Z3 J6 O8 M1 \
    过去一年多,算是ChatGPT的深度用户,感觉也不错,一直花钱买VIP。但是对国产大模型用的不多。一方面最开始用户体验不好,一方面自己内心还是有点看不起国内的大模型。内心是不希望ChatGPT输的,所以反复尝试了多次,还是不行。; O$ t6 ?; o, i, g: R

    8 E" j! \* F* G. U# a! l- p: z虽然GPT可能被我误导了,换个账号也许就没问题了?虽然这只个例,ChatGPT比国内大模型表现好的多了去了。但却破除了我心中的执念,以后有问题,也会在国内大模型试试了。
    5 E% M$ P8 Q) @, v3 Y3 H6 T' ^. y1 n3 @% J2 t

    7 K4 P2 ], l3 A( p
    & {0 u9 N+ s+ h2 N
    4 D2 U1 U) b- D3 c5 D# y( j- r' y1 b/ x/ c& \

    评分

    参与人数 4爱元 +36 收起 理由
    helloworld + 10
    方恨少 + 12
    pcb + 4
    johnsonjian + 10

    查看全部评分

  • TA的每日心情
    奋斗
    2021-4-20 05:43
  • 签到天数: 300 天

    [LV.8]合体

    沙发
     楼主| 发表于 2025-1-26 18:52:01 | 只看该作者
    个人推导错了 落了一个系数2.
    % `0 O2 C8 D, @$ w8 h- s' l: y) \7 T5 L" n& C
    这也是我们需要AI的原因啊
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    18 小时前
  • 签到天数: 3852 天

    [LV.Master]无

    板凳
    发表于 2025-1-26 22:43:24 | 只看该作者
    我没用过花钱的AI, 但是我觉得各有优缺点吧。2 l# i& E3 ^2 c# Y" e

    " f/ b6 Q( ^5 g: s6 Y" b1 p; [要是用中文问问题, 我喜欢国内开发的, 要是用英语问国产AI我会特意指名用英语搜国外的资源。& i& ^5 T8 {5 n2 K
      x( c* M+ Q7 i! _5 P
    即使美国的几个AI, 答案也不一致, 我都是一个问题问2,3个AI2 v% o7 I6 |) d) ^& A) R6 B" L

    " j4 o2 N! }% i现在搜索喜欢上了AI搜, 平时看我在用哪个笔记本, 工作上有一个笔记本上有vs code,所以顺手用了copilot;) O+ z) o  h# F9 _7 c1 }* w
    另外的一个笔记本我基本上只常规使用搜。$ J& ~% ^1 p4 a9 [. n+ T9 G' F
    & U- n4 p4 m4 l
    我个人的本上装了好几个AI, 经常每个问一下。
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    奋斗
    18 小时前
  • 签到天数: 3013 天

    [LV.Master]无

    地板
    发表于 2025-1-27 01:55:48 | 只看该作者
    马鹿 发表于 2025-1-26 22:43! J! l9 ]8 _! X1 ~
    我没用过花钱的AI, 但是我觉得各有优缺点吧。: G  Z- |, q$ l

    + R4 \1 E( a- V" M1 e0 M要是用中文问问题, 我喜欢国内开发的, 要是用英语问国产A ...
    我个人的本上装了好几个AI, 经常每个问一下。

    ! ~( ^, K- Z! \: u, k
    / `7 e6 k5 b, U  ^所以到底哪个更好?
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    慵懒
    2026-7-9 09:29
  • 签到天数: 2599 天

    [LV.Master]无

    5#
    发表于 2025-1-27 03:30:40 | 只看该作者
    Chatgpt数学非常不行。以下是个典型例子:
    # b9 ~$ f" {( k  \/ }4 f' V' S
    ; @8 E% [- q& i8 F9.11和9.9哪个大; ]' O2 g# ?- L2 a' a5 C
    ChatGPT said:+ }8 t# E8 d3 j* T3 ^% O7 t* y* I
    ChatGPT
    7 L' l+ F" h8 V  Q* ]: T8 o4 a1 X( c% ^9.11 比 9.9 大。
    , V8 K9 |5 |0 b2 g
    # V+ z6 m9 o+ }, L2 `6 c原因是比较小数时,先看整数部分:两者都是 9。然后看小数部分,从左到右逐位比较:! ~' s$ ^- X( q$ n9 a( I# }$ c; |( O

    - \8 z+ |) `6 s+ d& c- h6 X9.11 的小数第一位是 1,9.9 的小数第一位是 9。$ t# n. E* u, g) A
    由于 1 < 9,因此需要继续看下一位。
    ! V& ]4 J; H4 H: E- Z9.11 的小数第二位是 1,而 9.9 的小数第二位可以看作是隐含的 0(即 9.90)。6 U3 v7 |. w$ O. N9 g# l
    因为 1 > 0,所以 9.11 > 9.9。
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    18 小时前
  • 签到天数: 3852 天

    [LV.Master]无

    6#
    发表于 2025-1-27 03:44:05 | 只看该作者
    方恨少 发表于 2025-1-26 12:55
    # t( I: w: Y* F3 G所以到底哪个更好?
    2 h' U& _1 U% J7 j1 b+ X1 K
    说不上哪个好,真有要问的问题 都跟个遍, 看看哪个答案适合自己。 就连平时的搜索我都是bing 和google互相验证。
    回复 支持 反对

    使用道具 举报

    手机版|小黑屋|Archiver|网站错误报告|爱吱声   

    GMT+8, 2026-7-22 18:16 , Processed in 0.063207 second(s), 18 queries , Gzip On.

    Powered by Discuz! X3.2

    © 2001-2013 Comsenz Inc.

    快速回复 返回顶部 返回列表