设为首页收藏本站

爱吱声

 找回密码
 注册
搜索
查看: 3485|回复: 17
打印 上一主题 下一主题

[工程技术] 利用 Deepseek 抓取PDF的文字并矫正。

[复制链接]

该用户从未签到

跳转到指定楼层
楼主
 楼主| 发表于 2025-2-2 03:35:19 | 只看该作者 回帖奖励 |倒序浏览 |阅读模式
本帖最后由 nanimarcus 于 2025-2-6 22:17 编辑 + R7 q- C2 k4 [' r  m8 w0 C

6 d3 I7 r1 X3 P把PDF上传,然后让他抓取文字,并修改可能的错误。) v, \) c. ?9 U5 ^+ M
然后deepseek完美的完成了任务。
( x1 [3 {8 R) E8 b. `3 p. F段落清楚,列清楚,页眉页脚全部去掉。: ^1 r7 V; H7 Q% v
我要疯掉了!# R( {) N- b7 y7 E
赶紧把自己那些成年老书给搬出来,deepseek,这是党和人民考验你的时候了!
/ u9 {2 u. C$ h====
7 X1 Q7 q: d* }) k/ T, n中文也很完美。
0 E) x# q  B1 O( b经验值,每次十页比较稳定。" ?1 ^; d. Y$ W- |+ f$ O
现在我这里API还不能用,等恢复了,全自动了。, V" R* l" l8 U' F
====. |3 [; V; h; P8 M3 J
第二次疯掉了!
% H/ {& ]+ e+ g* ^5 H我上传英文文件后,让他抓取文字,矫正,然让他按页划分,前面放英文,后面放中文,结果仍然完美。5 c+ h8 o; e2 v$ |5 f- Q( e9 ?
====
+ t* Z5 \& z. Y1 H1 C1 F  Y' d: e现在我让他从PDF抓取文字,矫正后,按段落翻译,可以一次翻译多个段落,每次翻译不超过一个固定数目,结果仍然完美。
6 V3 j  V. i( T' B4 l+ w# b5 n但是任务多了后,每次翻译的页面数是减少的。7 \: s. m3 ~9 x7 f9 `) O
好吧,我五体投地,继续探索。
  J: W# ^  g1 v# u0 _====9 V  ^: H3 t: \& Z3 p6 L# g
为了防止中间结束,可以告诉他必须所有页面全部处理完就可以了,我现在是应该佩服我自己呢还是应该佩服 deepseek 呢,抑或都佩服。
1 p1 d# n8 B% Y% F) S5 n* t  G$ T/ r====
( _, i# P- i# a+ ?7 t0 m好吧,有些东西是不给翻译的,哈哈。
$ ^/ `  l9 x* V7 A4 q# {9 @( g0 {3 U: t, z- L" x3 B0 z( @" i) i7 h
Sorry, that's beyond my current scope. Let’s talk about something else.; M2 ]" o& N/ e" Y
====
& e3 q0 x) e5 m% Q! ?- e) D) J然后我的英文命令也让deepseek 帮我修改,呵呵。
! ]- [) @0 m0 d+ V/ M====  ?) _, ]  I& e
日语的文本他也可以处理,过程一模一样的。问题也是一模一样的,假名太多,汉字很少,我不懂日语,翻出来都不知道对不对。% L5 p' V& r5 A. F  S; m: B" A
====
# e. P  u  [2 V  E5 g, n' a" {时间段的话,北京时间的下午和晚上用比较好。
7 F. y! g: ]1 }! K# \后半夜和早上,美国人上班了,要么在用,要么在黑客攻击。% R7 o2 l* M9 m6 e! d8 ?7 E
====2 F' c8 p- r% Y# e
用千问吧,非常稳定,非常强大。( B5 n1 q0 @: E: D
https://chat.qwenlm.ai/5 r" Y, V7 a/ g' q
====8 E0 m1 t4 Q5 Z3 p# o" B
Deepseek,API 看上去可用了,但是不给充钱。
5 V6 c/ F6 a9 _1 k) o; R! k
7 M8 x( H# B8 J. e" U0 j3 b1 D5 w! `" e

$ T2 B% z4 C, l% r( e- @0 _

评分

参与人数 11爱元 +102 学识 +2 收起 理由
testjhy + 10
johnsonjian + 10
helloworld + 10
laser + 10
笑羽 + 10

查看全部评分

  • TA的每日心情
    开心
    9 小时前
  • 签到天数: 3873 天

    [LV.Master]无

    沙发
    发表于 2025-2-2 03:53:32 | 只看该作者
    这功能很赞呀

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    板凳
     楼主| 发表于 2025-2-2 03:56:21 | 只看该作者
    马鹿 发表于 2025-2-2 03:53
    - c& w7 t$ W* f: }% T% d这功能很赞呀

    ; i( d: ~) D4 s3 c2 q# p简直太赞了,我现在正在思考还有什么工作需要 deepseek 干的,现在的上限是我的上限,不是 deepseek 的上限。

    点评

    给力: 5.0 油墨: 5.0
    油菜: 5.0
    油墨: 5 油菜: 5
      发表于 2025-2-2 08:23
    给力: 5
      发表于 2025-2-2 04:41

    评分

    参与人数 2爱元 +20 收起 理由
    笑羽 + 10
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情

    2022-1-1 00:00
  • 签到天数: 793 天

    [LV.10]大乘

    地板
    发表于 2025-2-2 04:13:28 | 只看该作者
    有没有上传整本书试试
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    5#
     楼主| 发表于 2025-2-2 04:27:15 | 只看该作者
    indy 发表于 2025-2-2 04:13+ t% z, ]& c7 h7 |3 I2 A. |
    有没有上传整本书试试
    1 L: d# Y2 Q  o6 m: e
    目前看来,差不多十页左右就停止了,看看还有什么诀窍不。

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10 谢谢分享

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    9 小时前
  • 签到天数: 3873 天

    [LV.Master]无

    6#
    发表于 2025-2-2 04:41:51 | 只看该作者
    本帖最后由 马鹿 于 2025-2-1 15:43 编辑 3 |% `, ~& H. }1 n4 @' q# d
    " l7 P8 V( ~$ s5 H' O8 I
    以后让deepseek 读出土的竹简! l% z! w0 u" M  @" B, v% C. p* d

    1 ]# U$ L0 z' l0 b& r  L! C还有把古文翻译成现代白话
      B2 Q) }" F# I; a' _7 S& d8 q1 O, b' `" l$ ~  m' W0 a
    以后不认识的字不查字典了, 直接问deepseek
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    奋斗
    5 小时前
  • 签到天数: 3034 天

    [LV.Master]无

    7#
    发表于 2025-2-3 01:23:54 | 只看该作者
    请教是如何实现的?* m( o0 l, D  v3 D2 ~! ]

    7 B' I5 H4 E2 z4 n5 c; G我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后,发出指令提取文件中文字,始终是文件解析中。直接在DS里问如何上传PDF文件,并提取文件中文字,照做其实是一样的。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    8#
     楼主| 发表于 2025-2-3 03:06:35 | 只看该作者
    方恨少 发表于 2025-2-3 01:23% K3 ?( u$ w* p0 L& {/ k/ C$ H
    请教是如何实现的?' ?3 H9 ], o7 [( Y
    0 h% k+ U( V* Z* s( J% |9 t
    我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...
    8 o- z' R) P, i0 H, x) l: E
    1 X9 M3 `+ D" {
    我现在也上载不了了,"upload failed",几个小时前还好好的,应该是服务又受攻击所以功能收缩了。
    / h! @- K7 Q* s- v* P" w% h# I文字之类的没问题。估计deepseek现在暂时只保证主要功能。& o& ~1 A) E/ J7 W: u8 a/ r
    美国人就这样,打不过就耍流氓,估计要等一段时间才能完全恢复。
    8 Q6 X- j6 E; ]! i

    点评

    给力: 5.0 涨姿势: 5.0
    给力: 5 涨姿势: 5
      发表于 2025-2-3 03:40
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    9#
     楼主| 发表于 2025-2-5 00:15:37 | 只看该作者
    方恨少 发表于 2025-2-3 01:23
    . W/ J6 W1 s9 U请教是如何实现的?( `6 `/ b- z5 G  R

    3 T  E5 w8 E0 p5 W  N我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...

    - |: M# l! q' F0 khttps://chat.qwenlm.ai/  H: G6 A/ ?( P' v9 p# r
    试一下千问,估计美国人没有攻击他,所以资源敞开用。
    " v* p* G! W* K3 D: s& b很稳定,质量不错,好像最多一次处理15页。
    6 l( b+ [( }3 J6 }+ |7 U0 O' x我直接拿deepseek的指令用,没有区别。
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    9 小时前
  • 签到天数: 3138 天

    [LV.Master]无

    10#
    发表于 2025-4-16 17:01:29 | 只看该作者
    试了这个工具,可以转成markdown,正确率很高,有漏行,图片会放在一个指定的目录下。2 J1 S7 M  X; G% _
    处理一本100页左右的扫描版本的中文PDF,一份某行业的接口标准,纯CPU,几分钟时间。
    , F6 v4 D5 z, `8 h$ I8 P这个工具不能处理表格,我把文件拖到豆包里,“把这个文件中的表格转换成 markdown。只是表格,不需要其它内容”,表格多的话,要发好多次“请继续”。0 W  C  U# F# g, {$ V! Y) T/ ~

    5 n/ f+ a9 G; Ohttps://github.com/oomol-lab/pdf-craft' U9 R0 [  j  S# I( j( l

    4 G6 k3 p6 X" z& X+ ~  X1. 这个工具要求装 python3.10
    ( A/ }1 U; O' a( v. l' x" O/ W2. pip install onnxruntime==1.21.0, 有英伟达的卡:pip install onnxruntime-gpu==1.21.0
    ! s9 V8 x. ^* J5 s' }( Q4 m; b' {3. pip install pdf-craft& t2 L8 u5 a3 G
    4. 把下面的内容写到一个文件里,例如 a.py; R2 O! w% Z. `* ~# h/ |$ ^
    2 o) S1 ~( O5 I$ y
    1. from pdf_craft import PDFPageExtractor, MarkDownWriter
      4 @, k9 D: R+ G. T* \. m

    2. 8 \& Y4 ~* Q% C* L/ b
    3. extractor = PDFPageExtractor(0 r0 _6 J4 |1 E8 s: Q: p
    4.   device="cpu", # If you want to use CUDA, please change to device="cuda" format.
      4 A/ v7 h, _7 E# W% n- D' b" ^
    5.   model_dir_path="/path/to/model/dir/path", # The folder address where the AI ​​model is downloaded and installed
      / K+ z8 Q1 {: o- D  C7 {+ U
    6. )$ K: c0 S2 Z  T( k1 F# Q* d
    7. with MarkDownWriter(markdown_path, "images", "utf-8") as md:
      # n* Z7 ~& |0 t8 \! m, J; N. P
    8.   for block in extractor.extract(pdf="/path/to/pdf/file"):8 n! t9 x8 K2 K  {% g. }
    9.     md.write(block)
    复制代码

    4 \3 u8 R" R$ y7 _
    ( S' z) N8 T: i  p3 k要修改的内容:
    2 h( p4 c  o; k* \/ ~4.1 /path/to/model/dir/path:存放模型的路径。第一次运行这个脚本会从 huggingface.co 下一个模型,国内的要科学上网,国内的镜像上没这个模型+ \% ~2 L+ d9 H* c4 ]" J! z0 O
    4.2 markdown_path:输出的 markdown 路径文件名
    9 ]3 X) Y; h) q% ]$ ^8 a# `( M4 K2 e4.3 /path/to/pdf/file: 输入的源PDF路径文件名% ~( S$ W0 N- A
    # u* N9 ?! X& O2 V" U! e2 D
    5. 运行 python3 a.py

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 1 反对 0

    使用道具 举报

    该用户从未签到

    11#
     楼主| 发表于 2025-4-16 19:47:30 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-16 19:50 编辑 " }% n5 u* O/ |) D2 R

    ; f3 f; `& h2 D. I+ |: V- z/ B目前为止PDF转纯文字的最佳办法。* Z! G( }' F) o+ l1 h+ d0 D
    先写个小程序,把PDF按章节切成小的PDF。
    ( n6 E! r( w  e& i然后,把PDF一个个传到deepseek,让她抓取,除错,输出。- R) C' ~/ v0 [7 p2 }1 z& e* R
    效果非常好。" F2 B3 q2 W/ H3 y# Y& L4 C

    $ W0 y6 A1 C  S  @  G+ ^deepseek,qwen,chatgpt 三个,deepseek是最好的。; o4 S) l. y/ R- I5 b1 s
    - |) c6 S, P. M1 R# g
    deepseek 把页脚页眉页号全给去除干净了,跨页的段落也给你修好了。
    , }' i) |* O4 w而且deepseek不会加戏,chatgpt有时候会想当然的加上没有的文字,让句子看上去想那么回事。0 Q* ~' C) e+ w; H* K0 T
    我曾经修一个历史文章,chatgpt给我活活加了三段,真是文豪。
    $ X4 Q" z' g/ M/ e8 T" K0 h
    . ^9 m& a/ s) q6 C' oAPI到目前为止,差强人意,不如网页版本修得干净。
    ! ^  V; H5 ~9 V) h) S
    . I  i# C3 c5 v3 P1 G5 c# b! B" K- {deepseek可以同时开四个。
    , h" `' G. N% |7 _/ j# V

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    12#
    发表于 2025-4-17 12:26:23 | 只看该作者
    本帖最后由 三力思 于 2025-4-17 12:27 编辑
    4 B, t! _1 D+ G9 @* |3 T: @
    5 k, i5 I7 z3 |, d# Z6 B2 v让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    13#
     楼主| 发表于 2025-4-17 16:33:20 | 只看该作者
    三力思 发表于 2025-4-17 12:26. J5 W5 F4 v  [4 V3 m
    让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL ...
    * Q% n5 B4 X! ~" e! n
    细说一下,听上去很不错,多谢。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    14#
    发表于 2025-4-17 21:22:24 | 只看该作者
    nanimarcus 发表于 2025-4-17 16:336 }( m+ f3 N: s5 s: ~4 e
    细说一下,听上去很不错,多谢。
      A: \7 y% x# V! Y3 N7 R
    直接问DS,“用C#,JAVA语言开发把PDF分成单页PDF并上传DS程序的源代码”
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    15#
     楼主| 发表于 2025-4-17 21:55:57 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-18 15:39 编辑 * L$ @- J4 q) O9 a

    8 A1 Y6 S( H% }# {2 J已经搞定.0 f* _7 \- D" _5 _0 t; M

    * A5 M& b$ C* H- s首先 PDF 本身已经OCR了,Adobe Acrobat Pro中自带这个功能。
    ) q6 o5 b. [0 O! ]
    ' P# }  P* s/ E8 W0 n1, python + pypdf 按章节拆分小的PDF
    . ^; H. T- N8 S0 L% F* t9 u, x0 s3 S( a
    2, pdftotext -enc UTF-8 -nopgbrk -eol dos input outputfile
    & f/ j4 G$ w9 |
    4 W* K, {. l9 e; ~2 R得到text file  X7 S0 ]) m& R6 Y

    $ P+ d& A- |7 Y1 {" n3, python 读取整个outputfile,丢给deepseek 矫正。
    0 \% ]9 S) J& ~7 ]6 ^: M/ c& n# o9 h( B/ |  U
    模型是 deepseek-chat* r" V4 E+ e( o

      S- K& Q5 m' n. U$ wmax_tokens 最大是 8192,别的不用改。8 s% U! A; b  l* h
      t6 d6 P& K0 s
    参考:
    1 z& U& @% v4 G. Z( [6 \) Hhttps://api-docs.deepseek.com/api/create-chat-completion  C: O1 t& @' J% }: Z6 ]- F! M* G

    1 h! e5 j0 ^9 O* g4,费用:
    : Z- Y8 K. N+ G" N* S6 C! ]+ ^! F" |& }3 N. J3 z
    实测:+ ~$ F, u0 D$ r9 i5 M: q

    / s8 ~5 t) ]' I" @5 W  L296K 字母,用了 9 美分。" j6 n9 Z2 w9 v7 N1 t( O% |

    , W- M7 \- B0 B" q6 w& a( C/ J9 E4 V3 O英文字母 到 token 用量大约 1/3
    4 x. Y. c8 C, b7 G; D( ?
    5 Y2 i8 C; M. r$ b( c$ J2 |tokens: total, 11782 completion,  3729 prompt,  8053 | s:  32899
    ( i0 X1 ^/ l; P) j: G- t. b7 y" _
    9 ]/ u  k3 A% x) _) L+ f32899 个字母花费 11782 tokens,包含输入输出的 tokens: H' l- {6 z) V) h( V' H5 B/ E" x

    . U( j5 \  M, `价钱,非常非常便宜了。
    6 W. `7 c) a( U4 ?  k% x$ w) K1 S- l: S, n/ R3 j9 F2 ~
    参考如下可以计算,懒得算了。
    ; `3 |" {! g3 f8 {3 ?$ g+ o4 V. v1 d( B
    https://api-docs.deepseek.com/quick_start/pricing
    - \8 ]; O4 w+ i9 O) q  M8 h% U* z3 ?6 C4 R: C+ p
    1M TOKENS INPUT (CACHE HIT)(4)                $0.07                $0.14
    : a$ B% K8 M0 t1M TOKENS INPUT (CACHE MISS)                  $0.27                $0.55
    . }) b8 q! h+ Z! h# t5 b+ Q1M TOKENS OUTPUT(5)                                              $1.10                $2.19+ O  D+ z0 r% f6 X3 H7 L
    7 N5 y- m+ i! R1 M% ^
    5, Balance! w4 v3 d$ M: s
    . P3 ?" a/ r3 O; w; O' ?
    可以在程序里调用,知道每次运行结束后,balance还剩多少。; \" k9 ?) t, ~/ D- x" H/ _( ~
    参考:
    0 D, k, W; i% Z5 C5 ?https://api-docs.deepseek.com/api/get-user-balance
    1 @! [5 m: Z* g$ _4 h
    / x# {8 F6 t$ r+ u) ]1 ]6, Models2 j1 Y" _" X0 t# x
    3 x/ T6 x' r& |& D) t4 g
    目前就两个: h4 N# n8 m/ n* `
    # deepseek-chat+ g3 ~! F3 n3 {' o4 w2 H
    # deepseek-reasoner5 ~  N& v5 w% ]  b$ h6 x7 |( `
      \6 q5 z7 \: ~7 k
    参考:
    % K* o. W0 M- @; e( p9 B" A& S, }# nhttps://api-docs.deepseek.com/api/list-models
    4 p$ t3 ^- Q( s% m7 s0 E8 U5 o9 a' q* y) `

    / q# K$ l/ B0 }* U" c+ f7, 问题
    2 D. c2 W+ y. W- D! A  O$ U8 E. {: `9 _. h: R& e# n  m7 G
    deepseek 会将前后两段合成一段。, f4 N- g: E" T( l! t+ l* S' l3 S2 L
    特别是那种大量的对话的段落,deepseek会给你合成一大段。" R/ o& H1 e3 a, h* D
    ) E2 {, `: k' y& `+ p2 Y7 |0 f
    8, 钱说了算。0 ^7 J2 r  s1 M

    ( n. i3 T  R6 T* J3 M- edeepseek 如果是免费的网页版,有时候会出现超出范围的提示,不干了。6 o" X) Q) `' ~8 O, l' w' t# Z
    但是API就不会出现这种情况,毕竟我们给钱了。
    6 o/ @7 v, J/ M' `. achatgpt也是这样的。" }+ S5 p6 E7 q6 S2 g1 n

    3 t- W: d* D2 Z+ N
    , W3 G5 J) N& t6 D: ]  Y$ S

    评分

    参与人数 2爱元 +14 学识 +2 收起 理由
    唐家山 + 4
    老票 + 10 + 2 给力

    查看全部评分

    回复 支持 反对

    使用道具 举报

    手机版|小黑屋|Archiver|网站错误报告|爱吱声   

    GMT+8, 2026-8-12 09:59 , Processed in 0.074650 second(s), 17 queries , Gzip On.

    Powered by Discuz! X3.2

    © 2001-2013 Comsenz Inc.

    快速回复 返回顶部 返回列表