设为首页收藏本站

爱吱声

 找回密码
 注册
搜索
查看: 3726|回复: 17
打印 上一主题 下一主题

[工程技术] 利用 Deepseek 抓取PDF的文字并矫正。

[复制链接]

该用户从未签到

跳转到指定楼层
楼主
 楼主| 发表于 2025-2-2 03:35:19 | 只看该作者 回帖奖励 |倒序浏览 |阅读模式
本帖最后由 nanimarcus 于 2025-2-6 22:17 编辑
! c$ U5 ]  Q, I5 P! `! e
) Y/ m# G4 y/ I) S4 v+ ~# B把PDF上传,然后让他抓取文字,并修改可能的错误。8 z7 {& [: Z% H, `
然后deepseek完美的完成了任务。
# }9 g3 Y. G: r7 k段落清楚,列清楚,页眉页脚全部去掉。% W! t# @" y/ ?* j) R# J- O# a
我要疯掉了!# h6 x! \6 R& C9 e! J
赶紧把自己那些成年老书给搬出来,deepseek,这是党和人民考验你的时候了!
% Y+ P' [5 A7 e5 v5 a====
/ P, L. G1 r/ U" a中文也很完美。
  q5 b0 Y# f( h1 D0 w经验值,每次十页比较稳定。6 G1 @& c6 H3 ]' _& _
现在我这里API还不能用,等恢复了,全自动了。6 F) E6 ?5 I: _3 Y4 Q% Z% P
====6 b; r$ j- z  u9 o, m
第二次疯掉了!2 c1 L% `9 m  x$ b) o4 m( }' N* R2 s( b6 M3 Y
我上传英文文件后,让他抓取文字,矫正,然让他按页划分,前面放英文,后面放中文,结果仍然完美。
& j5 L5 L# C( k# B! L====( ^3 ?7 r; I& o6 t
现在我让他从PDF抓取文字,矫正后,按段落翻译,可以一次翻译多个段落,每次翻译不超过一个固定数目,结果仍然完美。, d9 G% ~1 [' ]0 @" R
但是任务多了后,每次翻译的页面数是减少的。
$ c% {. c7 [0 j( V$ l好吧,我五体投地,继续探索。* F$ w; d' c$ ?% S9 Y& f
====
* v; A% e9 i) S. A" L: x为了防止中间结束,可以告诉他必须所有页面全部处理完就可以了,我现在是应该佩服我自己呢还是应该佩服 deepseek 呢,抑或都佩服。
5 {5 ?3 E% n$ S' s" j# }====
6 T) ]4 ~0 X) `* b) E. {好吧,有些东西是不给翻译的,哈哈。
; P( C7 |) K& Q
4 G4 W6 T, `$ v( _: ^* G- H+ ISorry, that's beyond my current scope. Let’s talk about something else.
1 I) c/ }4 C& R  ~( ]% X: h====) A, T8 P, q( P+ O5 g, @& S: B
然后我的英文命令也让deepseek 帮我修改,呵呵。" A% I1 F4 ]+ l% L# n% [
====
2 @, l; L" f6 P, _日语的文本他也可以处理,过程一模一样的。问题也是一模一样的,假名太多,汉字很少,我不懂日语,翻出来都不知道对不对。
5 X: b' I) g# F+ e; X3 e, h2 N/ _' |====# K. w# u: z$ g: |/ ]% v
时间段的话,北京时间的下午和晚上用比较好。
0 U8 |; j1 _+ z( @1 ~后半夜和早上,美国人上班了,要么在用,要么在黑客攻击。
6 K. S5 j, G: z: \* S====, R& T5 j8 F; @3 W
用千问吧,非常稳定,非常强大。
, x6 l$ q4 M6 N8 e2 v- z' Hhttps://chat.qwenlm.ai/
8 p  H5 d4 b  z. W====
. k5 ^+ K. ]  L: v5 H5 CDeepseek,API 看上去可用了,但是不给充钱。& _' e3 z+ l5 u0 S1 m' W) @

; A+ x) T! {5 a/ E
, e3 T3 n: v! l9 _& R/ k% n" g/ l; k9 ~# T$ R( t$ j

评分

参与人数 11爱元 +102 学识 +2 收起 理由
testjhy + 10
johnsonjian + 10
helloworld + 10
laser + 10
笑羽 + 10

查看全部评分

  • TA的每日心情
    开心
    17 小时前
  • 签到天数: 3892 天

    [LV.Master]无

    沙发
    发表于 2025-2-2 03:53:32 | 只看该作者
    这功能很赞呀

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    板凳
     楼主| 发表于 2025-2-2 03:56:21 | 只看该作者
    马鹿 发表于 2025-2-2 03:53; q, I' F' ~) K" M, ]
    这功能很赞呀
    0 j5 V) b9 a- C
    简直太赞了,我现在正在思考还有什么工作需要 deepseek 干的,现在的上限是我的上限,不是 deepseek 的上限。

    点评

    给力: 5.0 油墨: 5.0
    油菜: 5.0
    油墨: 5 油菜: 5
      发表于 2025-2-2 08:23
    给力: 5
      发表于 2025-2-2 04:41

    评分

    参与人数 2爱元 +20 收起 理由
    笑羽 + 10
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情

    2022-1-1 00:00
  • 签到天数: 793 天

    [LV.10]大乘

    地板
    发表于 2025-2-2 04:13:28 | 只看该作者
    有没有上传整本书试试
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    5#
     楼主| 发表于 2025-2-2 04:27:15 | 只看该作者
    indy 发表于 2025-2-2 04:13$ n1 b9 n5 |) h
    有没有上传整本书试试
    8 b' `6 n2 Y  {5 G# a9 [
    目前看来,差不多十页左右就停止了,看看还有什么诀窍不。

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10 谢谢分享

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    17 小时前
  • 签到天数: 3892 天

    [LV.Master]无

    6#
    发表于 2025-2-2 04:41:51 | 只看该作者
    本帖最后由 马鹿 于 2025-2-1 15:43 编辑
    $ d; J5 ~) H) p% a: l" @. {3 ?9 R1 |; K7 H! W5 f) p
    以后让deepseek 读出土的竹简, o0 e2 t# G! @, W3 S' c  i

    ' L& k9 N0 a& J* Z% K/ L& l还有把古文翻译成现代白话
    % Z! u) k9 @- w8 g) d! R  e3 i& K! f# d2 c/ B& p" K
    以后不认识的字不查字典了, 直接问deepseek
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    奋斗
    12 小时前
  • 签到天数: 3054 天

    [LV.Master]无

    7#
    发表于 2025-2-3 01:23:54 | 只看该作者
    请教是如何实现的?1 z9 \  Y5 }7 S* z7 A. h8 n4 a

    ! Z/ ]( N! a+ u: ?+ d8 c我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后,发出指令提取文件中文字,始终是文件解析中。直接在DS里问如何上传PDF文件,并提取文件中文字,照做其实是一样的。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    8#
     楼主| 发表于 2025-2-3 03:06:35 | 只看该作者
    方恨少 发表于 2025-2-3 01:23# b, d* y$ ?; l* |. k8 J  n
    请教是如何实现的?
    . L& G$ y0 K+ b0 A8 a) G- i8 K  x4 s5 K2 U/ N7 c8 H
    我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...
    + V7 n! P- a" e4 z) F* N% F3 l3 L

    6 P; K- D, o  J. `我现在也上载不了了,"upload failed",几个小时前还好好的,应该是服务又受攻击所以功能收缩了。/ @9 h- |7 n) B$ P
    文字之类的没问题。估计deepseek现在暂时只保证主要功能。$ x  G* R) o  [8 u, b, A
    美国人就这样,打不过就耍流氓,估计要等一段时间才能完全恢复。
    : j* L: `8 R. M8 r$ Z0 K/ @, T

    点评

    给力: 5.0 涨姿势: 5.0
    给力: 5 涨姿势: 5
      发表于 2025-2-3 03:40
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    9#
     楼主| 发表于 2025-2-5 00:15:37 | 只看该作者
    方恨少 发表于 2025-2-3 01:23
    ) T( O9 _) w, w2 P! X0 {. P. T请教是如何实现的?$ g" f" x/ F% r/ A  M- x

    8 ~0 s" U. V! Q2 h0 ?我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...
    ' Z- D( q' h% x9 n& r
    https://chat.qwenlm.ai/) X* O* o7 T9 q( K. U" M
    试一下千问,估计美国人没有攻击他,所以资源敞开用。' ^" i. k$ Y* y! d8 z
    很稳定,质量不错,好像最多一次处理15页。6 d" E! }/ _7 t, l1 r
    我直接拿deepseek的指令用,没有区别。
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    17 小时前
  • 签到天数: 3155 天

    [LV.Master]无

    10#
    发表于 2025-4-16 17:01:29 | 只看该作者
    试了这个工具,可以转成markdown,正确率很高,有漏行,图片会放在一个指定的目录下。0 a* w) |! o# L" |$ D
    处理一本100页左右的扫描版本的中文PDF,一份某行业的接口标准,纯CPU,几分钟时间。: l  c' j$ {5 X/ ~" `- u& u
    这个工具不能处理表格,我把文件拖到豆包里,“把这个文件中的表格转换成 markdown。只是表格,不需要其它内容”,表格多的话,要发好多次“请继续”。
    1 I  \$ L% ]% o! L: G/ M% a
    , @7 K, y6 ]6 ^% r# Ehttps://github.com/oomol-lab/pdf-craft2 q; U) p. o" g

    & P3 J- @0 Q, m! k+ p9 v1. 这个工具要求装 python3.10
    ! R" g; V# o$ g- w4 t2. pip install onnxruntime==1.21.0, 有英伟达的卡:pip install onnxruntime-gpu==1.21.0. {3 G! w  R) H1 X# v
    3. pip install pdf-craft! V, p" W8 e2 _+ o" Z2 q' X3 a; U
    4. 把下面的内容写到一个文件里,例如 a.py
    6 l2 r# T. b: G$ G  u. \- k) @  |) t- M
    1. from pdf_craft import PDFPageExtractor, MarkDownWriter
      6 d' R5 J7 |) [, T4 E; G  ~7 g
    2. 6 x! c! l: O" D: M& {
    3. extractor = PDFPageExtractor(
      3 b6 v* ?. o! u* B- M& @
    4.   device="cpu", # If you want to use CUDA, please change to device="cuda" format.) f1 K% [+ D" M/ i& A2 L7 ^5 G
    5.   model_dir_path="/path/to/model/dir/path", # The folder address where the AI ​​model is downloaded and installed! p+ z5 C3 G3 [/ d# V4 ?3 k
    6. )1 g0 X% o5 e; Z" @
    7. with MarkDownWriter(markdown_path, "images", "utf-8") as md:! r( f  |1 H) H
    8.   for block in extractor.extract(pdf="/path/to/pdf/file"):  j# v5 `$ |5 U/ T- n6 V: Y0 a8 X6 f. O
    9.     md.write(block)
    复制代码

    : V' Z' z5 S7 S! v6 ]
    3 `8 a; S+ o! u) K, V$ w要修改的内容:5 o3 H/ B! E7 G# l) M- F9 ~2 `
    4.1 /path/to/model/dir/path:存放模型的路径。第一次运行这个脚本会从 huggingface.co 下一个模型,国内的要科学上网,国内的镜像上没这个模型
    8 F. O/ s' ^! x1 V. O% m4.2 markdown_path:输出的 markdown 路径文件名' h. Q2 }: b$ l" ~9 K$ h
    4.3 /path/to/pdf/file: 输入的源PDF路径文件名# `: e2 ^) c' P, v5 {1 s9 m
    # i3 ?1 D2 L" }! J# k# y
    5. 运行 python3 a.py

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 1 反对 0

    使用道具 举报

    该用户从未签到

    11#
     楼主| 发表于 2025-4-16 19:47:30 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-16 19:50 编辑 / z4 Z" t* l  d% n5 p' N' A

    & c( q6 w; {4 j7 S2 {/ D, J目前为止PDF转纯文字的最佳办法。9 u# g5 {1 |0 M8 d( O& P
    先写个小程序,把PDF按章节切成小的PDF。# c3 ]- o" s" u1 L6 @
    然后,把PDF一个个传到deepseek,让她抓取,除错,输出。, n9 d; d; P4 D0 X+ `! [
    效果非常好。
    % I7 A3 H7 Q9 D: P" q' p" L/ ^, O3 _% a, c
    deepseek,qwen,chatgpt 三个,deepseek是最好的。
    9 A3 [1 _+ V8 ^. h( R% E9 V' A# g4 R  x1 ?, h; ^, E
    deepseek 把页脚页眉页号全给去除干净了,跨页的段落也给你修好了。- M" p4 ?2 T. e7 M, K& \
    而且deepseek不会加戏,chatgpt有时候会想当然的加上没有的文字,让句子看上去想那么回事。% n3 g, J0 U7 S( u0 y$ {
    我曾经修一个历史文章,chatgpt给我活活加了三段,真是文豪。+ |  B. ~0 S/ Z, A# W# N0 X! C

    + t. j1 P8 `% e0 c" \( NAPI到目前为止,差强人意,不如网页版本修得干净。3 G: F0 s, u# h6 H) U
    ; @* x) U8 i3 E2 u8 S4 o
    deepseek可以同时开四个。$ v* D8 |8 x& \5 Y: c( n

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    12#
    发表于 2025-4-17 12:26:23 | 只看该作者
    本帖最后由 三力思 于 2025-4-17 12:27 编辑 2 k, M3 M4 S& `, X: g- J
    2 `9 R- L) A0 @% w4 |/ T
    让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    13#
     楼主| 发表于 2025-4-17 16:33:20 | 只看该作者
    三力思 发表于 2025-4-17 12:26" [" D- m( ]" W" ^; f8 h- l5 L
    让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL ...
    * l- f, i, r0 _* h% T9 c
    细说一下,听上去很不错,多谢。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    14#
    发表于 2025-4-17 21:22:24 | 只看该作者
    nanimarcus 发表于 2025-4-17 16:33
    # W3 W' ]$ ?9 U9 p1 ~* r2 W% f, o4 R细说一下,听上去很不错,多谢。
      c1 R! j( T, F4 w' c
    直接问DS,“用C#,JAVA语言开发把PDF分成单页PDF并上传DS程序的源代码”
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    15#
     楼主| 发表于 2025-4-17 21:55:57 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-18 15:39 编辑
    ; S  l% H) z+ z- U& \8 c/ }% k, N
    已经搞定.
    ) q  J3 ^- {6 r6 }. N/ [
    ! n6 r5 Z2 _. c' c8 Q8 i首先 PDF 本身已经OCR了,Adobe Acrobat Pro中自带这个功能。$ I  I+ Y& ]* Q
      h$ n' @% |; R& S, k: E. H
    1, python + pypdf 按章节拆分小的PDF
    ) R: i2 x; _8 k- }+ _4 S& D7 \( k1 U- l) ~: y; U4 ^2 M' [
    2, pdftotext -enc UTF-8 -nopgbrk -eol dos input outputfile
    9 g" R: L' @; v+ j0 S, p
    + O% k7 s* \2 ]" [+ v% S% E4 C$ D8 D得到text file5 G  W' O" t) N

    8 z/ a" t' L! a+ |$ h0 T! F3, python 读取整个outputfile,丢给deepseek 矫正。5 b. i9 b  |4 Y- y. T# o

    3 ~7 |$ t) f" `. S3 l4 v2 c模型是 deepseek-chat
    + A2 j9 P- q2 T; c9 W5 u. Y& A# B3 a: d  J- v+ m8 b
    max_tokens 最大是 8192,别的不用改。
      n) R0 O6 A. A( H9 J! n1 e" n8 `# d2 T0 n6 @' P+ \/ ^% X
    参考:
    & M  \7 Z( [7 b, k" mhttps://api-docs.deepseek.com/api/create-chat-completion8 k8 Y6 w' j; i

    " n% l6 @- {$ c6 M. Y4,费用:9 w5 i7 ?3 B' o6 u
    6 z& F$ p' ~# V8 l4 U; `! Q& G
    实测:
      F3 N: b$ `) g
    ' d" T$ o0 j1 M+ J) v296K 字母,用了 9 美分。2 \; [' S9 D$ m, l

    8 Y( e; {. P" B, N2 }, E, h英文字母 到 token 用量大约 1/39 U) l" E: W0 ~- v! N

    0 z5 A; H4 ?; X  t, }tokens: total, 11782 completion,  3729 prompt,  8053 | s:  32899
    2 N" d6 ~! E- S' l) m
    3 V, b+ w! K7 f! l0 Q, _  I$ u32899 个字母花费 11782 tokens,包含输入输出的 tokens
    5 @+ `# e" l8 l7 }0 O- ?) [! G2 i2 a  V4 g4 q$ ^* u
    价钱,非常非常便宜了。
    $ J0 Q, p8 R$ x* _: J- _
    ; ]; O2 |% M; l, L8 W参考如下可以计算,懒得算了。3 W) E3 s9 Q0 \, V$ I/ m

    ! b) G, _' R6 i6 q* t8 r/ ~* F, G! hhttps://api-docs.deepseek.com/quick_start/pricing$ G: ~3 B+ i% `% Y! ~7 N2 w) A

      e% I4 R4 y9 H1 F- @3 l& b" W1M TOKENS INPUT (CACHE HIT)(4)                $0.07                $0.147 K; l* y, W5 A# T" r( g, u( p
    1M TOKENS INPUT (CACHE MISS)                  $0.27                $0.55
    1 c, Z: }( ]4 i. f6 f5 c1M TOKENS OUTPUT(5)                                              $1.10                $2.19" k* P( n6 K) N% x2 w

    " \: k& R/ ^2 _5 @0 L/ B2 l5, Balance
    * }2 ^; |3 L% `# t/ C) y/ Q4 o) Z! {. q9 w6 s: c0 Y4 A% Q
    可以在程序里调用,知道每次运行结束后,balance还剩多少。
    $ Y# e# f5 }4 F5 U! \参考:
    & w* y, l2 k0 l' ~7 @https://api-docs.deepseek.com/api/get-user-balance
    ( i3 [* ~' p1 _  N2 e, S
    ( x, |" a6 [( B( V) Y5 `6, Models
    : ~, q: a  U  j0 P8 q( P# Y4 ]* _7 K
    目前就两个
    ! N) j7 T6 x1 [' m' y- y; y6 [# deepseek-chat
    + m1 [. e/ y- S6 ]# deepseek-reasoner
      A. |: x* O$ t- s6 \1 b, h* b  I  S- `
    " p( Y' t6 E- o2 L4 I4 d0 u* _" }参考:
    : `) D) F' z! a* c+ c' Ahttps://api-docs.deepseek.com/api/list-models! g. T5 M# }* E/ w5 M5 B3 s4 C

    , x3 \/ x2 i/ u; @# h7 Q; l" M" n. J% f
    7, 问题+ e8 M/ ~% T4 R% W% W

    8 H) M+ ?' \) ydeepseek 会将前后两段合成一段。: {1 `0 [' Z9 U+ I  [2 G. s. p
    特别是那种大量的对话的段落,deepseek会给你合成一大段。
    3 q6 b. L- k4 o) l% j3 s4 H) C3 h$ B: P
    8, 钱说了算。
    4 C9 l% z8 [" n; A8 `2 R' o: N  i$ c
    deepseek 如果是免费的网页版,有时候会出现超出范围的提示,不干了。9 I# n% v  W9 c: a  q9 }) u& B$ y
    但是API就不会出现这种情况,毕竟我们给钱了。
    9 v8 [. o3 H7 g  ]3 j5 v9 vchatgpt也是这样的。, F) f8 N4 o7 d6 G
    + |; h# L5 L1 g: M

    % i  ?4 q% l/ l3 Y; C1 p

    评分

    参与人数 2爱元 +14 学识 +2 收起 理由
    唐家山 + 4
    老票 + 10 + 2 给力

    查看全部评分

    回复 支持 反对

    使用道具 举报

    手机版|小黑屋|Archiver|网站错误报告|爱吱声   

    GMT+8, 2026-9-1 17:07 , Processed in 0.074336 second(s), 18 queries , Gzip On.

    Powered by Discuz! X3.2

    © 2001-2013 Comsenz Inc.

    快速回复 返回顶部 返回列表