设为首页收藏本站

爱吱声

 找回密码
 注册
搜索
查看: 3378|回复: 17
打印 上一主题 下一主题

[工程技术] 利用 Deepseek 抓取PDF的文字并矫正。

[复制链接]

该用户从未签到

跳转到指定楼层
楼主
 楼主| 发表于 2025-2-2 03:35:19 | 只看该作者 回帖奖励 |倒序浏览 |阅读模式
本帖最后由 nanimarcus 于 2025-2-6 22:17 编辑
/ o, n4 g- n" C; S) L" s3 J9 q0 R1 E- C9 v7 e5 p
把PDF上传,然后让他抓取文字,并修改可能的错误。: T' G% E% f% g8 w6 C
然后deepseek完美的完成了任务。
/ G8 U# T2 F" w* \/ a  r) R' {$ U段落清楚,列清楚,页眉页脚全部去掉。! S# f0 F; f2 n
我要疯掉了!9 A  M+ {0 J" n7 B; X
赶紧把自己那些成年老书给搬出来,deepseek,这是党和人民考验你的时候了!" Z7 H; O2 g8 b6 X, N4 a; \1 m
====
: M# `" c$ X! J. M4 T) g+ ?中文也很完美。# O, ~& \7 L* z, ~$ H' [
经验值,每次十页比较稳定。
; g; F+ d8 I. a# s4 V现在我这里API还不能用,等恢复了,全自动了。7 a/ I; V  g9 P- \* u" z' ^
====
/ Y1 A$ b' C1 a6 z第二次疯掉了!6 V2 F7 }- X  e! p9 ~
我上传英文文件后,让他抓取文字,矫正,然让他按页划分,前面放英文,后面放中文,结果仍然完美。9 v" B. e9 o5 G) \
====
  t$ l2 Q# Q& r现在我让他从PDF抓取文字,矫正后,按段落翻译,可以一次翻译多个段落,每次翻译不超过一个固定数目,结果仍然完美。3 J) ?4 t9 H; s' C% j
但是任务多了后,每次翻译的页面数是减少的。# O5 t2 a! [% B8 w) J# x
好吧,我五体投地,继续探索。
* o9 U3 w  R6 E6 [! t2 N" C====
9 u- H+ X+ Q4 C. m6 W5 ?4 U为了防止中间结束,可以告诉他必须所有页面全部处理完就可以了,我现在是应该佩服我自己呢还是应该佩服 deepseek 呢,抑或都佩服。
1 }; k5 @8 @& H6 x) x6 I" D====  B; j5 }* t) u- F
好吧,有些东西是不给翻译的,哈哈。
2 S# B9 ^) P" S0 f, ~) N7 b4 ?0 f' H! ?5 j9 e
Sorry, that's beyond my current scope. Let’s talk about something else.
  a; q5 s$ T/ U( p3 f+ {====
! z4 n2 Y1 J- n+ z然后我的英文命令也让deepseek 帮我修改,呵呵。8 ?8 d$ k& `: H: z- C/ u
====
# m$ _9 y! x; J! m4 [日语的文本他也可以处理,过程一模一样的。问题也是一模一样的,假名太多,汉字很少,我不懂日语,翻出来都不知道对不对。
! c- b# _% v2 P$ g  W$ @====
/ x2 {0 F, ]1 z, i时间段的话,北京时间的下午和晚上用比较好。9 Y( r/ M, V, r7 T& S) r9 `
后半夜和早上,美国人上班了,要么在用,要么在黑客攻击。: r1 K8 f& t* k1 n7 L+ g
====
5 {# z9 o7 ~4 o- i( K& `$ b* F用千问吧,非常稳定,非常强大。
% s% ~, p2 O0 r0 xhttps://chat.qwenlm.ai/
0 o+ S( N9 a. E2 Z+ @====, O8 F5 p+ K% N3 G) v& p& e
Deepseek,API 看上去可用了,但是不给充钱。+ H. [3 c. W8 v

( e* e" E6 C$ H; U8 Z% I
7 D/ f- b: s9 C9 k4 |
  ~& |- j, _2 a

评分

参与人数 11爱元 +102 学识 +2 收起 理由
testjhy + 10
johnsonjian + 10
helloworld + 10
laser + 10
笑羽 + 10

查看全部评分

  • TA的每日心情
    开心
    19 小时前
  • 签到天数: 3852 天

    [LV.Master]无

    沙发
    发表于 2025-2-2 03:53:32 | 只看该作者
    这功能很赞呀

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    板凳
     楼主| 发表于 2025-2-2 03:56:21 | 只看该作者
    马鹿 发表于 2025-2-2 03:53' l$ ?- a( F! ^6 Q  ^2 L% N( T
    这功能很赞呀

    ( J4 m5 U0 m) M: D0 y+ p) Y简直太赞了,我现在正在思考还有什么工作需要 deepseek 干的,现在的上限是我的上限,不是 deepseek 的上限。

    点评

    给力: 5.0 油墨: 5.0
    油菜: 5.0
    油墨: 5 油菜: 5
      发表于 2025-2-2 08:23
    给力: 5
      发表于 2025-2-2 04:41

    评分

    参与人数 2爱元 +20 收起 理由
    笑羽 + 10
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情

    2022-1-1 00:00
  • 签到天数: 793 天

    [LV.10]大乘

    地板
    发表于 2025-2-2 04:13:28 | 只看该作者
    有没有上传整本书试试
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    5#
     楼主| 发表于 2025-2-2 04:27:15 | 只看该作者
    indy 发表于 2025-2-2 04:13
    6 T1 S# H8 Z' W% j6 [6 \$ O有没有上传整本书试试

    ; ^9 J! A& j# d- F9 b6 g目前看来,差不多十页左右就停止了,看看还有什么诀窍不。

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10 谢谢分享

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    19 小时前
  • 签到天数: 3852 天

    [LV.Master]无

    6#
    发表于 2025-2-2 04:41:51 | 只看该作者
    本帖最后由 马鹿 于 2025-2-1 15:43 编辑 % _# F8 _5 W& D( D3 D# K. g& n

    & \- t3 l4 Y. c! E5 n以后让deepseek 读出土的竹简
    # K4 z, e5 ]6 w. e- c/ T" d: e
    1 F+ ~& H' B* S/ z  _# M还有把古文翻译成现代白话
    9 y4 G/ p' Q. D# W7 I
    6 P2 ~6 _; H( S4 C1 q6 n以后不认识的字不查字典了, 直接问deepseek
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    奋斗
    19 小时前
  • 签到天数: 3013 天

    [LV.Master]无

    7#
    发表于 2025-2-3 01:23:54 | 只看该作者
    请教是如何实现的?
    9 V6 @) |: _0 s% u( s
    ( |& v5 A4 a# u4 W* N我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后,发出指令提取文件中文字,始终是文件解析中。直接在DS里问如何上传PDF文件,并提取文件中文字,照做其实是一样的。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    8#
     楼主| 发表于 2025-2-3 03:06:35 | 只看该作者
    方恨少 发表于 2025-2-3 01:235 Q% J+ k0 Y3 v& N6 A2 |
    请教是如何实现的?) u+ f0 d! {0 S- L" E6 q9 l
    6 t* c& k0 z  O3 d; i  ~! D0 d" ^
    我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...

    $ \# j2 R' A. d  |0 O7 ]' ]/ V% J
    * M0 f! p9 u; v% \/ e* @我现在也上载不了了,"upload failed",几个小时前还好好的,应该是服务又受攻击所以功能收缩了。
    8 T( s: b- _- m; h& O9 e# H文字之类的没问题。估计deepseek现在暂时只保证主要功能。
    1 R( a$ y. F! |. j* j美国人就这样,打不过就耍流氓,估计要等一段时间才能完全恢复。
    % q" }& W1 |; A# i  @2 o& o

    点评

    给力: 5.0 涨姿势: 5.0
    给力: 5 涨姿势: 5
      发表于 2025-2-3 03:40
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    9#
     楼主| 发表于 2025-2-5 00:15:37 | 只看该作者
    方恨少 发表于 2025-2-3 01:23! l$ g4 z( W2 q  R+ o
    请教是如何实现的?" b) Y; @$ Y1 w6 b7 w+ q7 d

    " Q/ n4 M' O& m, {我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...
    ( e+ W$ T. i- }9 m+ w
    https://chat.qwenlm.ai/
    0 E3 Q7 \& \2 l3 d( ]试一下千问,估计美国人没有攻击他,所以资源敞开用。
    4 F; D/ h2 W! V- C/ U/ k7 G+ k7 Y$ K4 b很稳定,质量不错,好像最多一次处理15页。  h! @2 i, D! p! \- J7 G# P  g
    我直接拿deepseek的指令用,没有区别。
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    19 小时前
  • 签到天数: 3118 天

    [LV.Master]无

    10#
    发表于 2025-4-16 17:01:29 | 只看该作者
    试了这个工具,可以转成markdown,正确率很高,有漏行,图片会放在一个指定的目录下。7 s" T" H  r$ Y( \, i0 \3 K3 P
    处理一本100页左右的扫描版本的中文PDF,一份某行业的接口标准,纯CPU,几分钟时间。
    0 m2 y1 q3 P9 c! y* a4 }0 M这个工具不能处理表格,我把文件拖到豆包里,“把这个文件中的表格转换成 markdown。只是表格,不需要其它内容”,表格多的话,要发好多次“请继续”。
    # O) d4 a0 Z8 d5 v( D
    8 m. D9 ], ~  ]) g, R* |' |6 Khttps://github.com/oomol-lab/pdf-craft
    9 [/ ^7 ?1 B9 ]5 n, E1 A  O2 i
    / R% C" H+ |! p  x2 ]1 r- @: `+ m: v1. 这个工具要求装 python3.10
    ! T/ ?7 F. t9 j4 X# l2. pip install onnxruntime==1.21.0, 有英伟达的卡:pip install onnxruntime-gpu==1.21.0
    " Z3 D, V# F9 A) y8 }3. pip install pdf-craft1 S4 k* j3 p  z1 e3 k
    4. 把下面的内容写到一个文件里,例如 a.py" g" _9 b. b/ M) C

    2 Y$ v* x$ N1 o5 h* g; D
    1. from pdf_craft import PDFPageExtractor, MarkDownWriter( I0 q) _& p/ `. Q: m7 S2 `7 A

    2. & o- n0 {2 i. i6 P  B6 o
    3. extractor = PDFPageExtractor(. |0 i; `4 t# T6 X# O3 r
    4.   device="cpu", # If you want to use CUDA, please change to device="cuda" format." {( b8 o: s3 H; U# i  a
    5.   model_dir_path="/path/to/model/dir/path", # The folder address where the AI ​​model is downloaded and installed
      " s2 K0 h4 I# n: p4 p0 o
    6. )
      ( T' k  O' l9 A& E6 Z' ~4 O
    7. with MarkDownWriter(markdown_path, "images", "utf-8") as md:
      , W; w  K8 x' o: f3 a: a
    8.   for block in extractor.extract(pdf="/path/to/pdf/file"):2 D  d# O/ O* Q0 ^& K: e& q
    9.     md.write(block)
    复制代码

    ( @! ?; w+ K* f+ u* H( [+ U- L3 z( q. ?0 @( s: T1 n
    要修改的内容:
    ' b$ _4 t0 M* m$ M4.1 /path/to/model/dir/path:存放模型的路径。第一次运行这个脚本会从 huggingface.co 下一个模型,国内的要科学上网,国内的镜像上没这个模型9 i* a5 Y( G9 p7 R. j- o
    4.2 markdown_path:输出的 markdown 路径文件名
    9 T9 Q+ E% ~7 Q7 B/ r. a& q9 r' h: S+ v4.3 /path/to/pdf/file: 输入的源PDF路径文件名
    + d/ P; i) Y4 U2 T$ y5 Z* |$ V+ f" e! V# m& y$ s
    5. 运行 python3 a.py

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 1 反对 0

    使用道具 举报

    该用户从未签到

    11#
     楼主| 发表于 2025-4-16 19:47:30 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-16 19:50 编辑 6 F- {9 o( V9 y, w( L' a' C
    ) W, P" ~) [% }& J
    目前为止PDF转纯文字的最佳办法。0 X& i9 N8 n9 ^* y" z7 \
    先写个小程序,把PDF按章节切成小的PDF。
    & Q* \1 H$ K* H( Z然后,把PDF一个个传到deepseek,让她抓取,除错,输出。( H) f+ c8 q5 |, z  ]  u' D
    效果非常好。
    3 T! L% W4 ^3 c
    . z: k" f( y/ ^6 @  I1 sdeepseek,qwen,chatgpt 三个,deepseek是最好的。6 b0 ?, d! b, J
    , n' W& i+ m" q& ]$ e  Y
    deepseek 把页脚页眉页号全给去除干净了,跨页的段落也给你修好了。# a2 E  h5 d7 N4 Q5 o9 _
    而且deepseek不会加戏,chatgpt有时候会想当然的加上没有的文字,让句子看上去想那么回事。, f+ S+ A" @  C9 f% x1 B1 V( e
    我曾经修一个历史文章,chatgpt给我活活加了三段,真是文豪。! N) V8 P* j+ B9 M3 c
    : g' w1 H* }! X+ }/ U
    API到目前为止,差强人意,不如网页版本修得干净。
    # o' n7 W$ W1 l2 e- t6 b5 F
    6 S) M. K5 s; C. H# Ldeepseek可以同时开四个。
    / R  T' u+ T7 I1 U* @3 i

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    12#
    发表于 2025-4-17 12:26:23 | 只看该作者
    本帖最后由 三力思 于 2025-4-17 12:27 编辑 4 z4 r5 p6 U0 S# B$ G  {

    & |. }5 h. G" K0 }+ r让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    13#
     楼主| 发表于 2025-4-17 16:33:20 | 只看该作者
    三力思 发表于 2025-4-17 12:26: k$ D0 ?# b' Q4 b+ S
    让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL ...
    4 z: f* P. z6 X0 {- L
    细说一下,听上去很不错,多谢。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    14#
    发表于 2025-4-17 21:22:24 | 只看该作者
    nanimarcus 发表于 2025-4-17 16:33
    3 P" Z: f0 ~0 h% `9 Y细说一下,听上去很不错,多谢。
    * F0 h+ {5 p+ H- G& S6 n. l( y
    直接问DS,“用C#,JAVA语言开发把PDF分成单页PDF并上传DS程序的源代码”
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    15#
     楼主| 发表于 2025-4-17 21:55:57 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-18 15:39 编辑
    / m0 Z9 X; ?# P+ V4 d# Q* z  h' w! p2 z
    已经搞定.6 {7 l9 x% {- d/ U0 P$ A3 ~

    " g  r. l2 c# E- K. B' c首先 PDF 本身已经OCR了,Adobe Acrobat Pro中自带这个功能。
    ! [4 u' z# f5 e) j" N7 C) t! u; s/ o$ X% w. X' Z
    1, python + pypdf 按章节拆分小的PDF
    6 j& z6 l; w% `8 [6 m1 k( n4 J! E7 _0 P
    2, pdftotext -enc UTF-8 -nopgbrk -eol dos input outputfile# _- n2 R; z3 C1 g% B, r9 Y4 v

    & C9 [' l& W9 l9 o2 {得到text file
    ( F7 g4 N) T8 p, b6 [* k' |0 Y
    ' h# C9 l3 n  H* S8 R+ P3, python 读取整个outputfile,丢给deepseek 矫正。# |2 J9 i0 I* y: X

    ; v0 w2 b+ P3 d- S7 H+ ]4 \* K模型是 deepseek-chat
    - z6 u. ?. U. c" h, ]
    " R+ x1 W: l9 Gmax_tokens 最大是 8192,别的不用改。
    . [% n' Z( e, w8 _- L! \: {$ o2 ]: f$ W  y. l5 j) L4 H
    参考:0 m- t  B. c  f6 Q- O) r
    https://api-docs.deepseek.com/api/create-chat-completion- u$ @4 h& R8 |
    & D( [+ l7 ]* B; p- C! T
    4,费用:
    8 F6 l* l; o! S  w
      k8 w" g9 `0 x* B实测:5 D- K. x4 T9 Z4 ?# N9 i* G

    * d- @6 U& M, X$ k' Y/ I, E$ O296K 字母,用了 9 美分。
    ( @, M) P0 f+ E* j1 r/ c! o8 D" T1 d( I7 p- k) d6 L6 e. z2 y9 `
    英文字母 到 token 用量大约 1/3
    : [. q8 [2 g- z, Y/ g
    1 b2 ?4 r! D& ytokens: total, 11782 completion,  3729 prompt,  8053 | s:  32899' @. O* @9 j( x: z6 d# N9 l
    . y( u% _" W8 y; U# G4 x- }8 E
    32899 个字母花费 11782 tokens,包含输入输出的 tokens
    & R* ?( Z& Q. R9 ]0 o" F2 [- ~5 W# V1 F- g% |! G7 E
    价钱,非常非常便宜了。' e9 R0 I  U. e' H; R+ R

    ; ?5 v. X3 S, e- r9 `8 r# k3 {. g" y参考如下可以计算,懒得算了。
    # K, U) u: C0 i/ l2 G
    + V* }2 D( D; P  _$ N: D" k7 Z# h+ Uhttps://api-docs.deepseek.com/quick_start/pricing" K# |' Y6 D+ D

      ^0 c3 z  ]6 V1 h4 q1M TOKENS INPUT (CACHE HIT)(4)                $0.07                $0.14. i+ G* g: Z! h) R$ f
    1M TOKENS INPUT (CACHE MISS)                  $0.27                $0.55: E- _* Q: v8 v* G# O: H, d( _* C
    1M TOKENS OUTPUT(5)                                              $1.10                $2.19
    - E/ _9 p3 \6 o# J% H- u- c- @' h: I
    5, Balance
    , m( b9 V& h% i* u, I& q3 P- w( k: o* j5 ?
    可以在程序里调用,知道每次运行结束后,balance还剩多少。: A, _$ J0 t, m: G2 B! C, e! x
    参考:' j5 J! f" P6 }6 G4 V+ L
    https://api-docs.deepseek.com/api/get-user-balance! v+ k& h* u$ j, s
    # T$ f8 m# h1 s: h! z# ]' N" G6 C7 |
    6, Models
      Y! Z6 W! D1 c$ E  Z$ d9 v; [. h* |* X
    目前就两个7 D) j% j/ F/ K4 [1 C' ]
    # deepseek-chat. o# b: M7 o* U: b) V% m* w
    # deepseek-reasoner- n8 d0 j0 u# j6 _0 o* y6 w* A
    3 O# g% f2 r3 `
    参考:5 O8 K2 h; l$ {( z5 W# q
    https://api-docs.deepseek.com/api/list-models  r0 w3 M9 T* V

    : V6 g2 i3 K/ T& m3 D* h) J! }4 ]1 n* I" r( O3 A+ J" c8 s1 y/ r
    7, 问题
    + L" Q6 }5 Q( j$ K  P5 X
    1 X) h8 P* h1 \2 K3 Odeepseek 会将前后两段合成一段。7 F0 B: J5 W6 x: t
    特别是那种大量的对话的段落,deepseek会给你合成一大段。
    # B3 L7 u$ L9 \: S/ I" j* r+ r( P' ]* f& k4 b
    8, 钱说了算。
    ) Z. G' N7 S6 O* j+ ^: @0 r0 y- ], N5 b' P7 T+ {0 Y
    deepseek 如果是免费的网页版,有时候会出现超出范围的提示,不干了。4 s/ u- L+ k- D1 t8 F
    但是API就不会出现这种情况,毕竟我们给钱了。
    4 O; r; T# a* {2 T" U5 vchatgpt也是这样的。
    0 K7 L& [* P' N& [, M4 E+ B$ ]
    ' l$ b: M; a9 r+ z% {% q+ v6 V( @3 o, p

    评分

    参与人数 2爱元 +14 学识 +2 收起 理由
    唐家山 + 4
    老票 + 10 + 2 给力

    查看全部评分

    回复 支持 反对

    使用道具 举报

    手机版|小黑屋|Archiver|网站错误报告|爱吱声   

    GMT+8, 2026-7-22 19:57 , Processed in 0.077955 second(s), 19 queries , Gzip On.

    Powered by Discuz! X3.2

    © 2001-2013 Comsenz Inc.

    快速回复 返回顶部 返回列表