设为首页收藏本站

爱吱声

 找回密码
 注册
搜索
查看: 3723|回复: 17
打印 上一主题 下一主题

[工程技术] 利用 Deepseek 抓取PDF的文字并矫正。

[复制链接]

该用户从未签到

跳转到指定楼层
楼主
 楼主| 发表于 2025-2-2 03:35:19 | 只看该作者 回帖奖励 |倒序浏览 |阅读模式
本帖最后由 nanimarcus 于 2025-2-6 22:17 编辑 * J) `' {: r: j7 ?

" j& @+ t# c5 u% y& U8 ~把PDF上传,然后让他抓取文字,并修改可能的错误。" h8 v4 H+ T1 D) f  ~
然后deepseek完美的完成了任务。
  P7 h, H9 ^" N+ j+ \! x* o段落清楚,列清楚,页眉页脚全部去掉。
/ n* a! Y8 |8 l0 k/ ~! F- P( H* s我要疯掉了!
* w% h7 s' j& g& |1 g赶紧把自己那些成年老书给搬出来,deepseek,这是党和人民考验你的时候了!" ^8 u4 C9 M& o) H0 j
====
# g: n  N0 ?. I% U, X中文也很完美。
/ Z/ ~% J* ?$ c* G# t$ \4 K经验值,每次十页比较稳定。
8 y0 }3 r* y9 f3 R8 Z! S  B5 O# Y现在我这里API还不能用,等恢复了,全自动了。
) u. j! g$ e; `  S====" I2 p# |, o8 y0 `$ c/ K
第二次疯掉了!
8 B2 w# {! t4 g  P& R我上传英文文件后,让他抓取文字,矫正,然让他按页划分,前面放英文,后面放中文,结果仍然完美。
7 D( K& K0 [2 G- s/ N( h3 C; F& E====7 o9 y$ D7 R/ J0 g) Z$ k
现在我让他从PDF抓取文字,矫正后,按段落翻译,可以一次翻译多个段落,每次翻译不超过一个固定数目,结果仍然完美。
; K5 D3 G" a( `! Q" H1 W/ Z但是任务多了后,每次翻译的页面数是减少的。0 W. N4 |0 O0 ~) V0 O
好吧,我五体投地,继续探索。& t' ~0 W8 W0 v  U  O
====$ Y! t1 }6 d) }# B7 q: [* a
为了防止中间结束,可以告诉他必须所有页面全部处理完就可以了,我现在是应该佩服我自己呢还是应该佩服 deepseek 呢,抑或都佩服。
0 o/ t  C- e6 m  @5 g. p====
8 y% f2 a, p, P0 h, F: R好吧,有些东西是不给翻译的,哈哈。
8 S( [) c$ j: k1 I6 r$ T( ?
* ~+ r9 q+ ~# k9 Z! u' ]Sorry, that's beyond my current scope. Let’s talk about something else.: R9 C6 l: ~0 t! s( O+ l/ ~. {/ T
====
% V- Q6 H% D* W2 |6 ^然后我的英文命令也让deepseek 帮我修改,呵呵。# x$ B1 U/ b# m
====
) c% z6 H. h( U& u5 l( ?日语的文本他也可以处理,过程一模一样的。问题也是一模一样的,假名太多,汉字很少,我不懂日语,翻出来都不知道对不对。) b7 I$ D3 K0 X: d: T# Z
====! w- T8 o8 b5 m2 J/ O3 O# o. k) C# g
时间段的话,北京时间的下午和晚上用比较好。
. H* {" M7 k/ s% b4 ?2 @7 l后半夜和早上,美国人上班了,要么在用,要么在黑客攻击。$ i3 Y$ B( A& r1 V+ B0 j
====
* \  Y" |) r1 d/ |用千问吧,非常稳定,非常强大。. J( b; u1 u6 {
https://chat.qwenlm.ai/7 E% F# C3 s7 v( o4 u
====
5 g* F2 d4 }/ @# M: FDeepseek,API 看上去可用了,但是不给充钱。
' V6 _' {- ^) Y7 i" `. j6 ]/ D5 u5 M, Q3 ~) [
, G) J2 v5 S- G: P0 T6 d" U
) X& J  m$ I1 n6 [" y

评分

参与人数 11爱元 +102 学识 +2 收起 理由
testjhy + 10
johnsonjian + 10
helloworld + 10
laser + 10
笑羽 + 10

查看全部评分

  • TA的每日心情
    开心
    12 小时前
  • 签到天数: 3892 天

    [LV.Master]无

    沙发
    发表于 2025-2-2 03:53:32 | 只看该作者
    这功能很赞呀

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    板凳
     楼主| 发表于 2025-2-2 03:56:21 | 只看该作者
    马鹿 发表于 2025-2-2 03:53- @3 _1 q! t9 B* M3 Y9 j( g
    这功能很赞呀

    ' z0 j1 {5 M! u3 U- X- g7 T* M6 ?2 x/ ~简直太赞了,我现在正在思考还有什么工作需要 deepseek 干的,现在的上限是我的上限,不是 deepseek 的上限。

    点评

    给力: 5.0 油墨: 5.0
    油菜: 5.0
    油墨: 5 油菜: 5
      发表于 2025-2-2 08:23
    给力: 5
      发表于 2025-2-2 04:41

    评分

    参与人数 2爱元 +20 收起 理由
    笑羽 + 10
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情

    2022-1-1 00:00
  • 签到天数: 793 天

    [LV.10]大乘

    地板
    发表于 2025-2-2 04:13:28 | 只看该作者
    有没有上传整本书试试
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    5#
     楼主| 发表于 2025-2-2 04:27:15 | 只看该作者
    indy 发表于 2025-2-2 04:13* `3 R9 i9 e" ]
    有没有上传整本书试试

    * C3 c) m1 `9 [) E目前看来,差不多十页左右就停止了,看看还有什么诀窍不。

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10 谢谢分享

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    12 小时前
  • 签到天数: 3892 天

    [LV.Master]无

    6#
    发表于 2025-2-2 04:41:51 | 只看该作者
    本帖最后由 马鹿 于 2025-2-1 15:43 编辑 1 u( U, g# S, |8 B  ^* x5 |' e, @5 K- a

    / _  M* s( x( i以后让deepseek 读出土的竹简
    . g; {" R$ x$ F: V& Q* }3 c$ {+ E8 G0 Q/ A8 ~( N3 n" Z
    还有把古文翻译成现代白话) T* \) t8 Q& H- H5 c

    # p; H8 G6 V* Q$ F: M) V以后不认识的字不查字典了, 直接问deepseek
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    奋斗
    7 小时前
  • 签到天数: 3054 天

    [LV.Master]无

    7#
    发表于 2025-2-3 01:23:54 | 只看该作者
    请教是如何实现的?; I. ]6 L5 [: t  X

    $ w+ `0 U: I! \- L* s我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后,发出指令提取文件中文字,始终是文件解析中。直接在DS里问如何上传PDF文件,并提取文件中文字,照做其实是一样的。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    8#
     楼主| 发表于 2025-2-3 03:06:35 | 只看该作者
    方恨少 发表于 2025-2-3 01:23. i' `+ U! [9 T7 M. ^0 @& L- c
    请教是如何实现的?
    - }* Y* g3 g: K+ b2 t2 R5 L! A$ e5 u( o5 C! c* @) ]3 t
    我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...

    ; j. I/ o1 E: u6 n
    2 W% `. [3 y" f0 o8 ?6 w% v我现在也上载不了了,"upload failed",几个小时前还好好的,应该是服务又受攻击所以功能收缩了。5 z- A# h7 P' U1 ?! {, `/ [4 [
    文字之类的没问题。估计deepseek现在暂时只保证主要功能。/ S, r& F2 I, r/ O" M# e
    美国人就这样,打不过就耍流氓,估计要等一段时间才能完全恢复。
    & f; Q/ ]2 Q  a6 O* Y" I# d  r

    点评

    给力: 5.0 涨姿势: 5.0
    给力: 5 涨姿势: 5
      发表于 2025-2-3 03:40
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    9#
     楼主| 发表于 2025-2-5 00:15:37 | 只看该作者
    方恨少 发表于 2025-2-3 01:23) V# T6 X3 d# H) B" n* y
    请教是如何实现的?- a- O7 q4 g) J6 s+ R4 ^
    ' a7 R. L7 D% ^$ d  l3 A
    我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...
    7 J# \6 X' `* V( U: W
    https://chat.qwenlm.ai/' V* s! ^' A; z, X/ ], K% \: t( @
    试一下千问,估计美国人没有攻击他,所以资源敞开用。
    6 ~9 s$ p5 h1 q! p; b/ _$ q0 g1 |很稳定,质量不错,好像最多一次处理15页。
    $ J* {2 r; J( b我直接拿deepseek的指令用,没有区别。
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    12 小时前
  • 签到天数: 3155 天

    [LV.Master]无

    10#
    发表于 2025-4-16 17:01:29 | 只看该作者
    试了这个工具,可以转成markdown,正确率很高,有漏行,图片会放在一个指定的目录下。% Z( Q/ Y/ q" c2 L- u6 u) I
    处理一本100页左右的扫描版本的中文PDF,一份某行业的接口标准,纯CPU,几分钟时间。
    ' z; X5 i. {- L1 b! V: m这个工具不能处理表格,我把文件拖到豆包里,“把这个文件中的表格转换成 markdown。只是表格,不需要其它内容”,表格多的话,要发好多次“请继续”。! v" S9 g; \4 V' b' x3 p/ [, W

    8 f  B4 c* T/ Z; J/ ~: ]% Whttps://github.com/oomol-lab/pdf-craft. ~% @+ A( |8 |8 d! J

    ; H% F+ S4 J9 X1. 这个工具要求装 python3.10
    8 v0 B0 w9 i( m$ [4 K9 i- b4 T2. pip install onnxruntime==1.21.0, 有英伟达的卡:pip install onnxruntime-gpu==1.21.0, N- L1 v# p, ^* b0 q: ^& N
    3. pip install pdf-craft7 R* A6 f4 j2 B- _; }4 F. c) G& u+ a% c
    4. 把下面的内容写到一个文件里,例如 a.py2 v% L6 [1 V- f' D

    / F; B5 B; y' |6 }
    1. from pdf_craft import PDFPageExtractor, MarkDownWriter6 W$ f+ z/ a) {1 g1 `; b/ ~2 Y6 f8 _

    2. 5 P2 ?1 y+ X6 C& I# }* U
    3. extractor = PDFPageExtractor(
      # ~) P' R& b, ^7 s+ f! ~3 s4 U# W
    4.   device="cpu", # If you want to use CUDA, please change to device="cuda" format.5 ^. @/ @3 ]8 M# }' H; J8 o
    5.   model_dir_path="/path/to/model/dir/path", # The folder address where the AI ​​model is downloaded and installed
      ' S2 |, z3 M$ B
    6. )
      ; o) F, T0 Q. s# C1 b
    7. with MarkDownWriter(markdown_path, "images", "utf-8") as md:
      7 E& ?, y. n# R
    8.   for block in extractor.extract(pdf="/path/to/pdf/file"):9 k- |9 U  |6 D
    9.     md.write(block)
    复制代码

    + Y- `$ S( i$ ^0 k" K7 f! L- o5 A8 ]8 y. ^0 S  J; A9 R: O
    要修改的内容:
    " y/ u4 E1 F- m" c. E/ Y" g* E4.1 /path/to/model/dir/path:存放模型的路径。第一次运行这个脚本会从 huggingface.co 下一个模型,国内的要科学上网,国内的镜像上没这个模型
    1 t' Q3 ?' r: E- o: R4.2 markdown_path:输出的 markdown 路径文件名2 M, V% w" R  i& |( L
    4.3 /path/to/pdf/file: 输入的源PDF路径文件名
    % C. G- M; O- L: h) A6 S: W1 |! c1 U0 R
    5. 运行 python3 a.py

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 1 反对 0

    使用道具 举报

    该用户从未签到

    11#
     楼主| 发表于 2025-4-16 19:47:30 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-16 19:50 编辑 2 w7 }$ J5 S5 Y: q( i% P; N

    # O  _, D- J, q2 u: N目前为止PDF转纯文字的最佳办法。
    2 ?3 {7 e. r# h. R: g# Q先写个小程序,把PDF按章节切成小的PDF。
      @( o: ^  G0 E2 U! D4 ]" C然后,把PDF一个个传到deepseek,让她抓取,除错,输出。
    " e: T; H( R2 y- ]1 B效果非常好。
    . z+ y1 ?7 j" C2 b8 o( ^1 l" P
    1 k. N/ B  _1 H% Hdeepseek,qwen,chatgpt 三个,deepseek是最好的。! ~! @2 D7 n2 N% H; F" y

    * t- O5 b" o) V# ^% q/ |, ^deepseek 把页脚页眉页号全给去除干净了,跨页的段落也给你修好了。
    " s( L6 P9 o" ?( }: w而且deepseek不会加戏,chatgpt有时候会想当然的加上没有的文字,让句子看上去想那么回事。5 O1 @5 u# z' i/ B  {, ~* v  K1 A
    我曾经修一个历史文章,chatgpt给我活活加了三段,真是文豪。4 F" c9 p+ K# G' p/ P9 R- J

    $ c0 f' O7 `8 S- uAPI到目前为止,差强人意,不如网页版本修得干净。
    2 F) X" e. r1 K$ c: N) h
    1 a$ a  m; f0 c  U4 n6 ldeepseek可以同时开四个。& h+ c9 m) V1 ^: e

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    12#
    发表于 2025-4-17 12:26:23 | 只看该作者
    本帖最后由 三力思 于 2025-4-17 12:27 编辑
    ( V0 [/ k- s# o. N% u/ ~0 T: u# R$ U# e. ]% m2 j$ O9 o
    让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    13#
     楼主| 发表于 2025-4-17 16:33:20 | 只看该作者
    三力思 发表于 2025-4-17 12:26
      o7 E6 ]! a, V" g$ R4 O8 {让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL ...
    + N: x" H! S4 g1 U: S: q
    细说一下,听上去很不错,多谢。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    14#
    发表于 2025-4-17 21:22:24 | 只看该作者
    nanimarcus 发表于 2025-4-17 16:33" c' @* K. W2 z$ K& j
    细说一下,听上去很不错,多谢。

    ! J! r+ F4 e/ ?3 w" J直接问DS,“用C#,JAVA语言开发把PDF分成单页PDF并上传DS程序的源代码”
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    15#
     楼主| 发表于 2025-4-17 21:55:57 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-18 15:39 编辑
    ' i3 o  X# K) j) w4 u' _; ~! P/ \8 X! G: r0 H
    已经搞定.  P; n5 z& f  V& k

    0 _' Z6 K5 D+ {7 @3 m" p; j5 v首先 PDF 本身已经OCR了,Adobe Acrobat Pro中自带这个功能。+ \' n' |7 a; f8 Z

    ! z! C# i! j8 k- h1, python + pypdf 按章节拆分小的PDF
    4 R. ~0 m# F/ I  ]- a
    / l7 ]0 e$ P$ V( A! A3 s1 i7 K: X# d2, pdftotext -enc UTF-8 -nopgbrk -eol dos input outputfile
    . M8 g: |/ A0 x$ ]4 f2 j( u# Z) t' g3 ~2 V7 p- d+ F
    得到text file
    ( P' H( b, S4 j. P: u9 i) G8 L+ T" ^9 c& X
    3, python 读取整个outputfile,丢给deepseek 矫正。
    - j) C( j0 h& R8 k* n4 K# A
    5 D; D; E3 Q' \# t模型是 deepseek-chat
    * W, Y  }' q3 i( v. l3 h9 `+ z! i6 G* h1 F7 j/ j+ e
    max_tokens 最大是 8192,别的不用改。' _" i6 H- R. l& M+ B4 B: d

    0 i0 U; B! g" U, A参考:: l& v& w% Q& @; |0 }
    https://api-docs.deepseek.com/api/create-chat-completion
    , a( S6 [! e0 I5 W9 h$ d8 V7 {; r) E( \' @2 @/ n
    4,费用:, b5 d4 }: |6 k0 S5 I: O% G  U
    ( u3 P4 ]; ]2 M0 o7 f% Z; T5 E! r
    实测:
    ! ^$ o8 E6 N2 Y, ~9 z
    - K  ?' b& ^) L1 }296K 字母,用了 9 美分。( S* V5 F, f3 r4 B: a& u

    8 ~; u2 F1 N* p8 u0 c英文字母 到 token 用量大约 1/37 T8 y, g  L( C3 R& U

    2 l) I9 {' p9 |# Y0 \tokens: total, 11782 completion,  3729 prompt,  8053 | s:  32899
    8 p: j6 [5 @0 }3 e& D2 C
    2 z/ o: A% \/ J/ I3 X6 V32899 个字母花费 11782 tokens,包含输入输出的 tokens
    $ n, @# q+ q) y2 T% j8 M4 e8 }4 i1 L' U( I; d9 |
    价钱,非常非常便宜了。
    , Q% N: k, m5 T2 a
    4 s8 R  S) X+ I: R2 J+ U参考如下可以计算,懒得算了。. S) c3 I9 C: D3 J) F
    ; V2 u% i6 w9 y4 G# X! d0 y% x
    https://api-docs.deepseek.com/quick_start/pricing
      b0 s- N% S. q/ ]; R; S
    3 u+ p4 f0 g0 N" R1M TOKENS INPUT (CACHE HIT)(4)                $0.07                $0.14
    4 E% w8 Y+ H+ u& G) I. J8 h1M TOKENS INPUT (CACHE MISS)                  $0.27                $0.55
    - y" k* o: i5 I! [) L1M TOKENS OUTPUT(5)                                              $1.10                $2.19$ m; m6 n* E  O7 F1 V2 m" u7 y8 w

    + N- O" c0 R$ S$ _+ f5 A+ R3 q; ^5, Balance
    $ D9 S3 R( ?( h3 g1 j/ Q6 v" F% N* b7 c: }& e
    可以在程序里调用,知道每次运行结束后,balance还剩多少。
    1 H  M" J* I$ x参考:
    0 l; D3 n  Q/ p2 i- H" p- |! Yhttps://api-docs.deepseek.com/api/get-user-balance
    , \& r) [) e1 v$ K# }& R) z# J; b6 F8 W4 g) ]8 ]
    6, Models' ~; J# u0 T+ @0 n' y3 J0 m
    # {4 `0 O1 n4 I0 d) y
    目前就两个, W5 v; U9 J  K6 I  G
    # deepseek-chat
    ; ?8 D: c" J9 Y# deepseek-reasoner
    5 B& p0 ?+ _( O' Q9 A* Z+ Y7 _( @
    参考:# j2 b6 |+ H( j4 E$ b7 F7 f
    https://api-docs.deepseek.com/api/list-models# ]+ @% s' K) u. k
    : x; `- i+ Z$ N! C
    ( L- w% t2 E; U% C: _
    7, 问题+ N6 T# J' B/ w# u+ @" h

    9 ~$ _4 T  ]7 D4 y. ^9 M$ Odeepseek 会将前后两段合成一段。
    7 l* z+ `( Y( ^/ v) p8 A8 A特别是那种大量的对话的段落,deepseek会给你合成一大段。
    8 ^& O" j! P# o6 Y' Q$ q  ?1 I) D: R3 V
    8, 钱说了算。5 S/ J, X! a3 V9 N) `! u" F0 c  H
    5 }( F2 S5 a3 y0 y& k
    deepseek 如果是免费的网页版,有时候会出现超出范围的提示,不干了。
    2 i; B6 A, p+ f) s4 T/ E7 ?但是API就不会出现这种情况,毕竟我们给钱了。) D. c% l: j& J/ C
    chatgpt也是这样的。
    5 A+ X  Q7 D9 w0 H9 y8 X9 G; R- p, e" u) g3 C

    & t" y+ I9 ^& E! T- b3 N& h

    评分

    参与人数 2爱元 +14 学识 +2 收起 理由
    唐家山 + 4
    老票 + 10 + 2 给力

    查看全部评分

    回复 支持 反对

    使用道具 举报

    手机版|小黑屋|Archiver|网站错误报告|爱吱声   

    GMT+8, 2026-9-1 12:08 , Processed in 0.067791 second(s), 18 queries , Gzip On.

    Powered by Discuz! X3.2

    © 2001-2013 Comsenz Inc.

    快速回复 返回顶部 返回列表