爱吱声

标题: 中外大模型数学能力比拼 [打印本页]

作者: 可梦之    时间: 2025-1-26 17:34
标题: 中外大模型数学能力比拼
本帖最后由 可梦之 于 2025-1-26 17:57 编辑 6 G1 }2 g% M6 T1 x0 u

  z, Z0 x" I) |! E6 D5 K7 e遇到一个数学问题,懒得推导了。习惯性让GPT推一下。) B% E) A* r- e: V; Y
$ o# ?$ m2 x4 ?+ ?. w
最开始问题给错了,然后纠正了一下,貌似GPT就鬼打墙出不来了。给的答案也不对。
+ M9 r5 s! B- Z3 a
. x* {# i9 A( Q4 x: q# `+ L3 ^+ }2 q/ o9 R6 Q! g! E% T% i
可能受上下文影响。那重开一个对话,结果还是不对。要么说没有解+ s/ I' \- a4 O0 X

. T% o+ `- c( \& b
3 h0 }- ^+ K* j, V3 ^) \/ F
/ K- T3 [% o. B2 _2 x* {
0 t% A3 e  f6 A& ~3 j
6 h0 B9 ?7 S! e: l  _5 k0 X要么继续胡说八道。
( w( ~; u( a: `' s9 q3 W3 R; C) f) o) B. M( i

; T0 z9 Z' ]8 d: e. x) u抱着试试看的态度,把同样的问题扔给了豆包和deepseek。4 }7 }, Z* Y6 H# n& |1 e* |

7 X4 V( j! c8 f6 x  u( i- Fdeepseek速度快,结果也对,但是过程是不对的。& ]3 Y2 Z: Y* o3 ]
" ~. k% \/ e5 s6 o0 C0 b
* }6 g: J5 T% J& d
豆包过程比较绕,但是基本正确,结果也是对的。' g$ _" C+ d9 K" ]7 Q! Y9 I

( A- K  [1 q% y$ O
3 j6 m- h5 T2 D% p当然,都不如人推导的哈。
# W% v- p! Z; p! O8 F
: j; T, I' @$ D4 z8 g' ~- Y/ S, Z- r7 q
过去一年多,算是ChatGPT的深度用户,感觉也不错,一直花钱买VIP。但是对国产大模型用的不多。一方面最开始用户体验不好,一方面自己内心还是有点看不起国内的大模型。内心是不希望ChatGPT输的,所以反复尝试了多次,还是不行。- E9 q& T2 U2 H, @! i8 o

  ?% T# H& T) o% B. _1 |: Y+ E# Y虽然GPT可能被我误导了,换个账号也许就没问题了?虽然这只个例,ChatGPT比国内大模型表现好的多了去了。但却破除了我心中的执念,以后有问题,也会在国内大模型试试了。, R# p8 f; q  v+ a: e, h
8 ~: \0 w; H; Z; R( P0 l% F

3 C1 H1 b$ `; Z* N: E8 {) s# O2 {; u3 ?8 {

$ {8 ~& E" I8 l* x6 U. N- d& X+ N$ E1 |6 {+ C/ N; n

作者: 可梦之    时间: 2025-1-26 18:52
个人推导错了 落了一个系数2. 7 W$ |7 d1 G2 B2 l6 [% I8 T9 o' b$ A

" A# @7 o; d- m% q. P4 {这也是我们需要AI的原因啊
作者: 马鹿    时间: 2025-1-26 22:43
我没用过花钱的AI, 但是我觉得各有优缺点吧。
7 n% r: e! G* J: a5 {. C% C
  e" [% [. Z" y! p要是用中文问问题, 我喜欢国内开发的, 要是用英语问国产AI我会特意指名用英语搜国外的资源。" ?* d6 o- i+ Z5 p! u+ [
3 o, @  L% b6 Y/ k
即使美国的几个AI, 答案也不一致, 我都是一个问题问2,3个AI
( _* u) e4 r: C! }0 l2 c. d9 X8 M9 P$ ?- C- W4 `/ L8 S7 F+ p
现在搜索喜欢上了AI搜, 平时看我在用哪个笔记本, 工作上有一个笔记本上有vs code,所以顺手用了copilot;% h( m, t& j; [% l+ z' O
另外的一个笔记本我基本上只常规使用搜。% K% g5 T) F& W) V8 h9 q5 N2 |" O8 U

% ?0 B$ E- L$ _( e$ b我个人的本上装了好几个AI, 经常每个问一下。
作者: 方恨少    时间: 2025-1-27 01:55
马鹿 发表于 2025-1-26 22:43  t& g6 c: l' Y5 A0 m$ e1 A# J
我没用过花钱的AI, 但是我觉得各有优缺点吧。( }  C0 J; z9 k& P3 L9 V. I
/ b/ j- x7 e- T5 |' H8 W' S
要是用中文问问题, 我喜欢国内开发的, 要是用英语问国产A ...
我个人的本上装了好几个AI, 经常每个问一下。
3 {8 _2 Z% Z3 I4 x2 o# }1 l
  C# Z0 R9 ~6 O1 g, {+ F% x# w
所以到底哪个更好?
作者: 松叶牡丹    时间: 2025-1-27 03:30
Chatgpt数学非常不行。以下是个典型例子:8 m' H) A, G" M: ?
8 Y' z! P$ @: L4 _1 h, E; ?: w% A
9.11和9.9哪个大
3 ?. ]  M: V0 l8 E5 F) TChatGPT said:
7 d; g: t0 p1 L1 r  v2 A5 QChatGPT! `# x( k6 V9 C9 n
9.11 比 9.9 大。& K% e3 k. J6 p& c$ C4 K
; z% S) A! a  X4 L
原因是比较小数时,先看整数部分:两者都是 9。然后看小数部分,从左到右逐位比较:: T' u! I. [7 U9 @* V

. a8 V; v; T- n4 y5 }3 r5 z* J5 p9.11 的小数第一位是 1,9.9 的小数第一位是 9。
" x( q$ O" ]2 h由于 1 < 9,因此需要继续看下一位。& q, V% L  w. T0 ?* {$ I" N2 b+ E; W
9.11 的小数第二位是 1,而 9.9 的小数第二位可以看作是隐含的 0(即 9.90)。
% Y' W$ o; y5 x0 s5 }因为 1 > 0,所以 9.11 > 9.9。
作者: 马鹿    时间: 2025-1-27 03:44
方恨少 发表于 2025-1-26 12:55
+ w. t' {4 ], y& K所以到底哪个更好?
( ], v! R0 B, f: j
说不上哪个好,真有要问的问题 都跟个遍, 看看哪个答案适合自己。 就连平时的搜索我都是bing 和google互相验证。




欢迎光临 爱吱声 (http://aswetalk.net/bbs/) Powered by Discuz! X3.2