设为首页收藏本站

爱吱声

 找回密码
 注册
搜索
查看: 3725|回复: 17
打印 上一主题 下一主题

[工程技术] 利用 Deepseek 抓取PDF的文字并矫正。

[复制链接]

该用户从未签到

跳转到指定楼层
楼主
 楼主| 发表于 2025-2-2 03:35:19 | 只看该作者 回帖奖励 |倒序浏览 |阅读模式
本帖最后由 nanimarcus 于 2025-2-6 22:17 编辑 * N; C2 b4 p3 x: R  q9 Q3 c

4 ~( Q1 v9 E+ E9 K# l把PDF上传,然后让他抓取文字,并修改可能的错误。
* E! t2 _* A+ v! X# R# ]7 C& M3 B然后deepseek完美的完成了任务。
# L# t$ j5 k( V* ]段落清楚,列清楚,页眉页脚全部去掉。
( Y! B2 y7 L4 ~我要疯掉了!# ]* x" f( L) V( R  l
赶紧把自己那些成年老书给搬出来,deepseek,这是党和人民考验你的时候了!$ f* D/ D' r" [
====
' P. {" s& v, X. \中文也很完美。
& J1 g+ C6 }: E! }# ^5 P/ H; b  ?经验值,每次十页比较稳定。
) d, X: r7 P5 G# T: W现在我这里API还不能用,等恢复了,全自动了。( H$ g+ K7 F/ v
====; V* c" |$ i* N1 u! |$ {( s
第二次疯掉了!! \! M9 \; r0 W- x( e9 D7 g. E8 M8 l
我上传英文文件后,让他抓取文字,矫正,然让他按页划分,前面放英文,后面放中文,结果仍然完美。
4 f+ B: b* e$ x5 M/ g  s1 C5 T====
9 R5 o: Z9 G* z. B1 L0 H: ]  _现在我让他从PDF抓取文字,矫正后,按段落翻译,可以一次翻译多个段落,每次翻译不超过一个固定数目,结果仍然完美。% X: \: M4 U) p, M
但是任务多了后,每次翻译的页面数是减少的。0 C* ~/ b7 W* x$ k9 U& U0 t
好吧,我五体投地,继续探索。- A8 v/ S- \9 o, `! |
====
; {) u9 g+ n9 O7 k1 E/ z9 K为了防止中间结束,可以告诉他必须所有页面全部处理完就可以了,我现在是应该佩服我自己呢还是应该佩服 deepseek 呢,抑或都佩服。
% b* n, k$ H. U  |  N====
, C( X1 G- d  p+ U9 `% ^* e) X! @5 u好吧,有些东西是不给翻译的,哈哈。
* i& R1 @2 b& _( G4 p5 R! Z( U9 c8 f4 \: @& ^) b
Sorry, that's beyond my current scope. Let’s talk about something else.0 o/ u: D' `! ?. ^+ `4 C
====
; f7 h  Z" l  Q# i4 A% _然后我的英文命令也让deepseek 帮我修改,呵呵。% R3 S* Z/ w( _4 A4 c, g2 v4 }
====
# P0 ^2 L1 l$ b: C/ _日语的文本他也可以处理,过程一模一样的。问题也是一模一样的,假名太多,汉字很少,我不懂日语,翻出来都不知道对不对。
4 a/ g9 Q8 o0 p5 z% _4 [! n$ i! [====
$ c  `4 d# i6 [时间段的话,北京时间的下午和晚上用比较好。
" O8 J9 Z" e) s: n0 e$ l6 t# |+ e后半夜和早上,美国人上班了,要么在用,要么在黑客攻击。
6 t  _' j/ y+ O====6 x9 g8 O6 G4 \. J
用千问吧,非常稳定,非常强大。( l, o  M9 x) @, N7 A# m3 Z1 y
https://chat.qwenlm.ai/3 K( a' D- W- @& V5 N
====, ~# D5 H3 {6 g- D' \
Deepseek,API 看上去可用了,但是不给充钱。
4 A* |( _) O4 z& W
2 }0 [& W4 V  P  N6 Z% }
: l2 b* D: d' j. _# D& ?& J
7 b' I' w  u8 E: i

评分

参与人数 11爱元 +102 学识 +2 收起 理由
testjhy + 10
johnsonjian + 10
helloworld + 10
laser + 10
笑羽 + 10

查看全部评分

  • TA的每日心情
    开心
    13 小时前
  • 签到天数: 3892 天

    [LV.Master]无

    沙发
    发表于 2025-2-2 03:53:32 | 只看该作者
    这功能很赞呀

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    板凳
     楼主| 发表于 2025-2-2 03:56:21 | 只看该作者
    马鹿 发表于 2025-2-2 03:532 t& _$ h7 H* I, T# E( {1 ?
    这功能很赞呀

    ( j2 |, N, z5 S简直太赞了,我现在正在思考还有什么工作需要 deepseek 干的,现在的上限是我的上限,不是 deepseek 的上限。

    点评

    给力: 5.0 油墨: 5.0
    油菜: 5.0
    油墨: 5 油菜: 5
      发表于 2025-2-2 08:23
    给力: 5
      发表于 2025-2-2 04:41

    评分

    参与人数 2爱元 +20 收起 理由
    笑羽 + 10
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情

    2022-1-1 00:00
  • 签到天数: 793 天

    [LV.10]大乘

    地板
    发表于 2025-2-2 04:13:28 | 只看该作者
    有没有上传整本书试试
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    5#
     楼主| 发表于 2025-2-2 04:27:15 | 只看该作者
    indy 发表于 2025-2-2 04:13/ J' A  X7 p$ u, ^) m% ?
    有没有上传整本书试试

    ) ~, G* i+ ?+ g目前看来,差不多十页左右就停止了,看看还有什么诀窍不。

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10 谢谢分享

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    13 小时前
  • 签到天数: 3892 天

    [LV.Master]无

    6#
    发表于 2025-2-2 04:41:51 | 只看该作者
    本帖最后由 马鹿 于 2025-2-1 15:43 编辑
    ' ~, l) M/ C, r6 C, w! J  \1 M
    9 Q3 }$ f# E: ~* C( U以后让deepseek 读出土的竹简
    / k( f5 I" A# o" i/ k# {  d4 ~% J2 E/ b7 r1 y( ?
    还有把古文翻译成现代白话5 g. B4 M! R$ \
    4 m9 r, Z: [3 Z  [8 W, K
    以后不认识的字不查字典了, 直接问deepseek
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    奋斗
    9 小时前
  • 签到天数: 3054 天

    [LV.Master]无

    7#
    发表于 2025-2-3 01:23:54 | 只看该作者
    请教是如何实现的?
    2 _' _% [2 U6 e( w% |& Y$ d
    : [2 _) i5 M7 A$ P我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后,发出指令提取文件中文字,始终是文件解析中。直接在DS里问如何上传PDF文件,并提取文件中文字,照做其实是一样的。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    8#
     楼主| 发表于 2025-2-3 03:06:35 | 只看该作者
    方恨少 发表于 2025-2-3 01:23
    ; _% |% t0 Z3 p9 B; v请教是如何实现的?2 q; X8 t: U/ U" a3 c% L% n: f
    ) H, g5 Q: J- `" D1 J4 G; m
    我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...

    4 B+ G4 O9 ?( b6 K
    # s5 M6 [" Q# K我现在也上载不了了,"upload failed",几个小时前还好好的,应该是服务又受攻击所以功能收缩了。
    . b. y( O) T2 ~文字之类的没问题。估计deepseek现在暂时只保证主要功能。
    7 D) R/ |( s: V9 Q: B美国人就这样,打不过就耍流氓,估计要等一段时间才能完全恢复。8 ^# K9 m  {: |& H* z" a6 E

    点评

    给力: 5.0 涨姿势: 5.0
    给力: 5 涨姿势: 5
      发表于 2025-2-3 03:40
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    9#
     楼主| 发表于 2025-2-5 00:15:37 | 只看该作者
    方恨少 发表于 2025-2-3 01:23
    / n0 F8 c5 [  Y9 N: m% `请教是如何实现的?. i+ N; L% ?( K4 u3 L, U
    4 ?8 u2 \& U' L3 _+ t
    我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...

    7 v, D8 @! G5 l& e. q7 ^4 ]https://chat.qwenlm.ai/
    ! A' S6 c6 |$ Z0 `9 s. u试一下千问,估计美国人没有攻击他,所以资源敞开用。, o& R" p) w& ^" @
    很稳定,质量不错,好像最多一次处理15页。3 {$ ^# M- M& P) u; R
    我直接拿deepseek的指令用,没有区别。
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    13 小时前
  • 签到天数: 3155 天

    [LV.Master]无

    10#
    发表于 2025-4-16 17:01:29 | 只看该作者
    试了这个工具,可以转成markdown,正确率很高,有漏行,图片会放在一个指定的目录下。3 Z  b% \& a  A9 H+ V* B4 {; A
    处理一本100页左右的扫描版本的中文PDF,一份某行业的接口标准,纯CPU,几分钟时间。4 Z9 q. d9 G( m% ?- ^
    这个工具不能处理表格,我把文件拖到豆包里,“把这个文件中的表格转换成 markdown。只是表格,不需要其它内容”,表格多的话,要发好多次“请继续”。
    6 ]- w1 z* m- y# z, o
    / m5 \; N, d# d8 hhttps://github.com/oomol-lab/pdf-craft6 s9 }, x9 w; y8 B! _
      z! o; U7 o4 n9 B1 p* d
    1. 这个工具要求装 python3.10& m# [0 L% H# X* Y8 Z% ]
    2. pip install onnxruntime==1.21.0, 有英伟达的卡:pip install onnxruntime-gpu==1.21.0
    + L! r0 K7 m, r' c3 w' u/ J& S3. pip install pdf-craft
    4 n1 [- m. I, A# C8 r4. 把下面的内容写到一个文件里,例如 a.py4 V, G9 h& V) E+ R9 h
    , \2 M8 B( |. A6 E% v: p
    1. from pdf_craft import PDFPageExtractor, MarkDownWriter
      + b# f" `2 m' ]2 {

    2. & ^  k, D' b: e, p0 ^1 f) P
    3. extractor = PDFPageExtractor($ f5 u: [0 T% Q& d
    4.   device="cpu", # If you want to use CUDA, please change to device="cuda" format.
      + d" B) k4 F5 L
    5.   model_dir_path="/path/to/model/dir/path", # The folder address where the AI ​​model is downloaded and installed
      ! j+ P9 f. ]4 z5 Q& z9 `
    6. )
        X# N2 j2 q  O
    7. with MarkDownWriter(markdown_path, "images", "utf-8") as md:
      ! g7 U+ J% l. O# D( V
    8.   for block in extractor.extract(pdf="/path/to/pdf/file"):
      : T! ^' c8 ]; X! d3 |
    9.     md.write(block)
    复制代码
    1 N0 ^9 _# I7 t# S* a( K8 ?& B
    ' x$ M: j% @& p% {6 X( }7 e
    要修改的内容:2 B8 L% n! u8 y% v& x" r2 M
    4.1 /path/to/model/dir/path:存放模型的路径。第一次运行这个脚本会从 huggingface.co 下一个模型,国内的要科学上网,国内的镜像上没这个模型: B2 S' D+ b+ @% H6 `
    4.2 markdown_path:输出的 markdown 路径文件名
    8 R- z' o; a  b& j" F7 h, I4.3 /path/to/pdf/file: 输入的源PDF路径文件名
    * U. u. P+ e+ g3 e- u8 ?9 K0 d7 N; N& n' ~
    5. 运行 python3 a.py

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 1 反对 0

    使用道具 举报

    该用户从未签到

    11#
     楼主| 发表于 2025-4-16 19:47:30 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-16 19:50 编辑 & f/ @; W* Z9 r

    0 {3 Q" h) r9 ^% w4 ~+ L; l: U目前为止PDF转纯文字的最佳办法。. x4 P& r' C% @! H
    先写个小程序,把PDF按章节切成小的PDF。
    ! x5 W7 g4 |2 e1 l# o( Q( E1 e$ t然后,把PDF一个个传到deepseek,让她抓取,除错,输出。
    : a7 E6 z/ ~8 }7 t' `; h效果非常好。
    * Y2 p2 u% S* E) s! |9 U$ w
    5 X* ~+ A- A! A6 G; sdeepseek,qwen,chatgpt 三个,deepseek是最好的。
    ; y% i) |* f, \$ G! P+ h
    # Y, }; w4 F- \6 b9 n; mdeepseek 把页脚页眉页号全给去除干净了,跨页的段落也给你修好了。
    9 w+ u) W2 j, T: G而且deepseek不会加戏,chatgpt有时候会想当然的加上没有的文字,让句子看上去想那么回事。7 A1 |9 i6 h0 G" d# [7 ]* B  r
    我曾经修一个历史文章,chatgpt给我活活加了三段,真是文豪。
    5 @2 H, }8 V2 M0 }* f# Y0 }5 v* j' O$ O* N9 Z7 T/ z1 r* J
    API到目前为止,差强人意,不如网页版本修得干净。3 {$ t/ r$ A" p: y1 \0 s+ ~. g% ]: {

    " g/ v$ A/ Q  k) E) K; Hdeepseek可以同时开四个。: O5 |2 a. r4 X3 F

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    12#
    发表于 2025-4-17 12:26:23 | 只看该作者
    本帖最后由 三力思 于 2025-4-17 12:27 编辑
    2 w5 i# `% Y0 z, h4 f" w: a0 n( V" L
    让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    13#
     楼主| 发表于 2025-4-17 16:33:20 | 只看该作者
    三力思 发表于 2025-4-17 12:26
    / z$ |* h6 A3 {' a让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL ...

    6 I( z$ K5 z. H. j细说一下,听上去很不错,多谢。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    14#
    发表于 2025-4-17 21:22:24 | 只看该作者
    nanimarcus 发表于 2025-4-17 16:33
    ; P3 c# Q& q5 Y0 Q' Y细说一下,听上去很不错,多谢。
    " `6 A, m! ^- ^/ q: \+ t
    直接问DS,“用C#,JAVA语言开发把PDF分成单页PDF并上传DS程序的源代码”
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    15#
     楼主| 发表于 2025-4-17 21:55:57 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-18 15:39 编辑 - d; v% H+ B3 i- o1 ^) L

    " h  r9 H; f* G0 \# ~已经搞定.
    - s: |6 F$ A4 h5 K. V' P) J* p
    . [! d) k, T: T" F首先 PDF 本身已经OCR了,Adobe Acrobat Pro中自带这个功能。" L# h2 H5 p; L$ i3 n
    7 e: F/ d: R# }' H2 [2 |8 S
    1, python + pypdf 按章节拆分小的PDF
    . z$ e" B5 t, T; X3 O- j
    0 x4 y0 F! a# t" v2, pdftotext -enc UTF-8 -nopgbrk -eol dos input outputfile
    # }" u) Z1 |% M3 N' Y: ^& V$ F0 Z' v. N  J" o' ?8 K- ]; c
    得到text file7 k& ^! T# p: _8 u9 U

    & h5 I+ g  m" d+ ?; E0 _4 a2 C3, python 读取整个outputfile,丢给deepseek 矫正。
    2 V& g. G7 p5 S) j% t7 c8 m2 b! V; [: |8 x$ c) P% x
    模型是 deepseek-chat" ~6 H  Q9 X+ |+ W8 V) n

    - t5 X2 S4 f' Bmax_tokens 最大是 8192,别的不用改。0 F# `/ R: T7 T4 @4 H* [+ [( k
    " F( Q3 T7 }2 `0 L; P
    参考:
      P3 Q1 F$ Z' Q+ j0 Zhttps://api-docs.deepseek.com/api/create-chat-completion$ a# Z, e7 |7 `) M
    . W7 H  ]4 U# k* U9 ^% ?; u2 j' j0 K
    4,费用:
    % G& k3 Y  U7 Q2 t. z5 s2 _
    % R) x5 i, P; {实测:: G6 \( v: H9 C/ q# J3 M3 g

    , B: q! ~3 h! D* S0 f; g2 l$ Y296K 字母,用了 9 美分。
    9 \4 a4 m; i1 i  @/ D9 ^, m/ g- B/ s5 |' |, ^
    英文字母 到 token 用量大约 1/3" M5 Q3 B0 Y+ o5 T; J

    , ?: I$ P6 z  F: ?$ K/ Y$ E$ d$ stokens: total, 11782 completion,  3729 prompt,  8053 | s:  32899
    + ~, m5 S) M9 E- R; o% ?
    % i* |& T+ F9 m- B. j32899 个字母花费 11782 tokens,包含输入输出的 tokens+ C; F. X. p: |
    / b/ n5 m1 M* Z1 s1 y
    价钱,非常非常便宜了。
    ( k0 `# c  D+ K) u2 s6 z
    3 Y( m2 a3 n' p4 {9 p& F* V参考如下可以计算,懒得算了。  s% ^  J% Q1 N( W* A

    ) S! f; }0 A7 ^* t+ c; q6 }https://api-docs.deepseek.com/quick_start/pricing
    ( b. ]* f4 y. A
    6 M; _+ Y% _/ V3 ?2 E1M TOKENS INPUT (CACHE HIT)(4)                $0.07                $0.14
    ! I/ [! [2 ^; f7 ~" A# h% f+ O1M TOKENS INPUT (CACHE MISS)                  $0.27                $0.556 a" a1 s- P8 L; n% D& q
    1M TOKENS OUTPUT(5)                                              $1.10                $2.19
    * l) S0 _- N5 W  L5 a
    ) h; P* C, X; w/ j  m5, Balance
    & f7 E9 O! f  Q; a3 [# o: H' Y
    ! G7 ^* f( ^! a0 p# M6 z8 ~0 B/ k可以在程序里调用,知道每次运行结束后,balance还剩多少。
    3 z; S% x  G; f参考:
    * Q5 B$ t% f& Z8 \4 u2 W- t- Shttps://api-docs.deepseek.com/api/get-user-balance& {5 j/ X2 ]6 a- j" S

      H5 `! g9 i; p* ]% C" }6, Models# v2 a& G' A7 X8 X/ X0 U
    ; u7 A+ f! T& A4 O
    目前就两个
    " y* `% ]. ?0 |0 y1 s) q# deepseek-chat
    : E  C) e  p% b$ X% w% W# deepseek-reasoner
    + c+ _) |# h/ z% ]( f1 f: F; l
    6 ?" m) y& {! d参考:
    ; _9 L) D+ c$ G+ r2 |https://api-docs.deepseek.com/api/list-models
    3 F+ N5 N: s: a# E/ V& I# ]$ J1 a( _6 V. F1 J$ ~
    # ?$ L+ P% E7 a! c" K
    7, 问题
    & H3 u) L9 V1 m" F! U. n0 C
    $ h  w) ~/ M7 u4 tdeepseek 会将前后两段合成一段。" u' l) Y; `' M6 @; q
    特别是那种大量的对话的段落,deepseek会给你合成一大段。
    5 l- ~9 C4 H# _  k
    # _5 h" W+ e5 P+ F8, 钱说了算。' P' E( Z* D1 E1 l. l
    ; i6 {% _% T5 l$ a+ p  s' X3 N+ j/ }
    deepseek 如果是免费的网页版,有时候会出现超出范围的提示,不干了。
    % `, B: b$ N- @0 h7 J& c8 Y但是API就不会出现这种情况,毕竟我们给钱了。' p- b& h+ ^* s- i* `- q8 s
    chatgpt也是这样的。, J" D1 l' U% q7 B' q* F8 h
      L+ z- {) o5 W9 i# P
    , @' ?4 g( h4 K3 h7 g" L1 H  U

    评分

    参与人数 2爱元 +14 学识 +2 收起 理由
    唐家山 + 4
    老票 + 10 + 2 给力

    查看全部评分

    回复 支持 反对

    使用道具 举报

    手机版|小黑屋|Archiver|网站错误报告|爱吱声   

    GMT+8, 2026-9-1 13:35 , Processed in 0.072199 second(s), 19 queries , Gzip On.

    Powered by Discuz! X3.2

    © 2001-2013 Comsenz Inc.

    快速回复 返回顶部 返回列表