|
|
本帖最后由 nanimarcus 于 2025-4-18 15:39 编辑
/ m0 Z9 X; ?# P+ V4 d# Q* z h' w! p2 z
已经搞定.6 {7 l9 x% {- d/ U0 P$ A3 ~
" g r. l2 c# E- K. B' c首先 PDF 本身已经OCR了,Adobe Acrobat Pro中自带这个功能。
! [4 u' z# f5 e) j" N7 C) t! u; s/ o$ X% w. X' Z
1, python + pypdf 按章节拆分小的PDF
6 j& z6 l; w% `8 [6 m1 k( n4 J! E7 _0 P
2, pdftotext -enc UTF-8 -nopgbrk -eol dos input outputfile# _- n2 R; z3 C1 g% B, r9 Y4 v
& C9 [' l& W9 l9 o2 {得到text file
( F7 g4 N) T8 p, b6 [* k' |0 Y
' h# C9 l3 n H* S8 R+ P3, python 读取整个outputfile,丢给deepseek 矫正。# |2 J9 i0 I* y: X
; v0 w2 b+ P3 d- S7 H+ ]4 \* K模型是 deepseek-chat
- z6 u. ?. U. c" h, ]
" R+ x1 W: l9 Gmax_tokens 最大是 8192,别的不用改。
. [% n' Z( e, w8 _- L! \: {$ o2 ]: f$ W y. l5 j) L4 H
参考:0 m- t B. c f6 Q- O) r
https://api-docs.deepseek.com/api/create-chat-completion- u$ @4 h& R8 |
& D( [+ l7 ]* B; p- C! T
4,费用:
8 F6 l* l; o! S w
k8 w" g9 `0 x* B实测:5 D- K. x4 T9 Z4 ?# N9 i* G
* d- @6 U& M, X$ k' Y/ I, E$ O296K 字母,用了 9 美分。
( @, M) P0 f+ E* j1 r/ c! o8 D" T1 d( I7 p- k) d6 L6 e. z2 y9 `
英文字母 到 token 用量大约 1/3
: [. q8 [2 g- z, Y/ g
1 b2 ?4 r! D& ytokens: total, 11782 completion, 3729 prompt, 8053 | s: 32899' @. O* @9 j( x: z6 d# N9 l
. y( u% _" W8 y; U# G4 x- }8 E
32899 个字母花费 11782 tokens,包含输入输出的 tokens
& R* ?( Z& Q. R9 ]0 o" F2 [- ~5 W# V1 F- g% |! G7 E
价钱,非常非常便宜了。' e9 R0 I U. e' H; R+ R
; ?5 v. X3 S, e- r9 `8 r# k3 {. g" y参考如下可以计算,懒得算了。
# K, U) u: C0 i/ l2 G
+ V* }2 D( D; P _$ N: D" k7 Z# h+ Uhttps://api-docs.deepseek.com/quick_start/pricing" K# |' Y6 D+ D
^0 c3 z ]6 V1 h4 q1M TOKENS INPUT (CACHE HIT)(4) $0.07 $0.14. i+ G* g: Z! h) R$ f
1M TOKENS INPUT (CACHE MISS) $0.27 $0.55: E- _* Q: v8 v* G# O: H, d( _* C
1M TOKENS OUTPUT(5) $1.10 $2.19
- E/ _9 p3 \6 o# J% H- u- c- @' h: I
5, Balance
, m( b9 V& h% i* u, I& q3 P- w( k: o* j5 ?
可以在程序里调用,知道每次运行结束后,balance还剩多少。: A, _$ J0 t, m: G2 B! C, e! x
参考:' j5 J! f" P6 }6 G4 V+ L
https://api-docs.deepseek.com/api/get-user-balance! v+ k& h* u$ j, s
# T$ f8 m# h1 s: h! z# ]' N" G6 C7 |
6, Models
Y! Z6 W! D1 c$ E Z$ d9 v; [. h* |* X
目前就两个7 D) j% j/ F/ K4 [1 C' ]
# deepseek-chat. o# b: M7 o* U: b) V% m* w
# deepseek-reasoner- n8 d0 j0 u# j6 _0 o* y6 w* A
3 O# g% f2 r3 `
参考:5 O8 K2 h; l$ {( z5 W# q
https://api-docs.deepseek.com/api/list-models r0 w3 M9 T* V
: V6 g2 i3 K/ T& m3 D* h) J! }4 ]1 n* I" r( O3 A+ J" c8 s1 y/ r
7, 问题
+ L" Q6 }5 Q( j$ K P5 X
1 X) h8 P* h1 \2 K3 Odeepseek 会将前后两段合成一段。7 F0 B: J5 W6 x: t
特别是那种大量的对话的段落,deepseek会给你合成一大段。
# B3 L7 u$ L9 \: S/ I" j* r+ r( P' ]* f& k4 b
8, 钱说了算。
) Z. G' N7 S6 O* j+ ^: @0 r0 y- ], N5 b' P7 T+ {0 Y
deepseek 如果是免费的网页版,有时候会出现超出范围的提示,不干了。4 s/ u- L+ k- D1 t8 F
但是API就不会出现这种情况,毕竟我们给钱了。
4 O; r; T# a* {2 T" U5 vchatgpt也是这样的。
0 K7 L& [* P' N& [, M4 E+ B$ ]
' l$ b: M; a9 r+ z% {% q+ v6 V( @3 o, p
|
评分
-
查看全部评分
|