设为首页收藏本站

爱吱声

 找回密码
 注册
搜索
查看: 3376|回复: 17
打印 上一主题 下一主题

[工程技术] 利用 Deepseek 抓取PDF的文字并矫正。

[复制链接]

该用户从未签到

跳转到指定楼层
楼主
 楼主| 发表于 2025-2-2 03:35:19 | 只看该作者 回帖奖励 |倒序浏览 |阅读模式
本帖最后由 nanimarcus 于 2025-2-6 22:17 编辑
$ s) M8 z/ \$ ?1 Q( D" e" k# t% Y1 K0 `3 R, i
把PDF上传,然后让他抓取文字,并修改可能的错误。
* |: F/ A* @8 J/ _. T0 T& l然后deepseek完美的完成了任务。
+ ?) b/ W& p& I  A段落清楚,列清楚,页眉页脚全部去掉。
( p# K# u/ W3 a# A# I: q我要疯掉了!
: H5 U1 U# s% B! a2 \% \! p  E6 y, Z# i1 i赶紧把自己那些成年老书给搬出来,deepseek,这是党和人民考验你的时候了!
. j- }- m% N2 k8 ~  Y3 Q====
* s$ n6 j& ?3 k% O9 D0 G7 ]6 b中文也很完美。# N4 k( |4 E1 J, ~
经验值,每次十页比较稳定。; l. ]1 s; D- X; o6 @! V
现在我这里API还不能用,等恢复了,全自动了。
. q+ B, A* p+ u====) b+ L2 y4 e/ P" `
第二次疯掉了!
  ~+ c' C  }: b) E: l% {4 Z& ~& _1 P2 Y我上传英文文件后,让他抓取文字,矫正,然让他按页划分,前面放英文,后面放中文,结果仍然完美。
1 i+ G' g: u; P' f5 p; b$ S' [3 ?====% E" Q7 |. {+ Q
现在我让他从PDF抓取文字,矫正后,按段落翻译,可以一次翻译多个段落,每次翻译不超过一个固定数目,结果仍然完美。0 r' n+ f1 d/ j) A+ M9 w. Q
但是任务多了后,每次翻译的页面数是减少的。. K; V2 E2 u* x3 ?7 I- c8 i6 W
好吧,我五体投地,继续探索。  i4 h: t* ]3 U' G6 q
====
) o& C5 N& l9 h为了防止中间结束,可以告诉他必须所有页面全部处理完就可以了,我现在是应该佩服我自己呢还是应该佩服 deepseek 呢,抑或都佩服。; n/ u4 G" z/ w) ?4 d! ?
====) z7 A) }4 u0 l; q3 _- i
好吧,有些东西是不给翻译的,哈哈。& v' K7 E( i3 L+ y. {0 i$ z
# [* e2 G* q' ?
Sorry, that's beyond my current scope. Let’s talk about something else.
& G5 K1 v- n9 E% y8 G( u0 P2 M8 _====4 x. O: R" [. Y2 p/ l
然后我的英文命令也让deepseek 帮我修改,呵呵。! v, G  o% Z; {( \8 k! L
====, ]3 y& h; u" [0 {- r+ o3 A  T7 J
日语的文本他也可以处理,过程一模一样的。问题也是一模一样的,假名太多,汉字很少,我不懂日语,翻出来都不知道对不对。, B# [7 n( G# o; \7 c' s3 w# Y
====
" f% a4 i  Q: f$ }* \3 O时间段的话,北京时间的下午和晚上用比较好。
& Z3 @5 t9 P8 {: x4 y6 s后半夜和早上,美国人上班了,要么在用,要么在黑客攻击。
7 {+ I: i' N' T- f8 L0 O% D====
* A) c! K  v  D& x  S2 I3 w用千问吧,非常稳定,非常强大。
6 H6 G  C6 n- z8 ]% zhttps://chat.qwenlm.ai/
1 {3 K5 A( a% I4 [* W====
3 a3 l+ n0 o1 k& xDeepseek,API 看上去可用了,但是不给充钱。
+ v! d: x% k  b1 E
% X5 f8 n5 ]1 V+ t. ?2 [, z" O/ P$ I! R# ^

5 z$ c# o, `* J% h# j

评分

参与人数 11爱元 +102 学识 +2 收起 理由
testjhy + 10
johnsonjian + 10
helloworld + 10
laser + 10
笑羽 + 10

查看全部评分

  • TA的每日心情
    开心
    10 小时前
  • 签到天数: 3852 天

    [LV.Master]无

    沙发
    发表于 2025-2-2 03:53:32 | 只看该作者
    这功能很赞呀

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    板凳
     楼主| 发表于 2025-2-2 03:56:21 | 只看该作者
    马鹿 发表于 2025-2-2 03:53
    5 Q. o3 Y: u+ T; U# P  H  p这功能很赞呀

    * n; a# D# A  p简直太赞了,我现在正在思考还有什么工作需要 deepseek 干的,现在的上限是我的上限,不是 deepseek 的上限。

    点评

    给力: 5.0 油墨: 5.0
    油菜: 5.0
    油墨: 5 油菜: 5
      发表于 2025-2-2 08:23
    给力: 5
      发表于 2025-2-2 04:41

    评分

    参与人数 2爱元 +20 收起 理由
    笑羽 + 10
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情

    2022-1-1 00:00
  • 签到天数: 793 天

    [LV.10]大乘

    地板
    发表于 2025-2-2 04:13:28 | 只看该作者
    有没有上传整本书试试
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    5#
     楼主| 发表于 2025-2-2 04:27:15 | 只看该作者
    indy 发表于 2025-2-2 04:13' R5 [5 t# J/ o  E6 {
    有没有上传整本书试试
    % h7 a9 r2 S: G" I4 m$ z
    目前看来,差不多十页左右就停止了,看看还有什么诀窍不。

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10 谢谢分享

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    10 小时前
  • 签到天数: 3852 天

    [LV.Master]无

    6#
    发表于 2025-2-2 04:41:51 | 只看该作者
    本帖最后由 马鹿 于 2025-2-1 15:43 编辑 8 `1 r, v+ t" Q5 \8 v. C9 Q

    $ `! `: B" r2 j" ^& \2 h" U$ e以后让deepseek 读出土的竹简3 w1 z# K  P) @& P/ }1 [1 f7 B' _

    - ?1 Z7 E8 X: T# N0 ~* b& `还有把古文翻译成现代白话' z" {( y& i  P$ `. i; N
    ( l) M3 d/ g# D3 p. W; h- E
    以后不认识的字不查字典了, 直接问deepseek
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    奋斗
    10 小时前
  • 签到天数: 3013 天

    [LV.Master]无

    7#
    发表于 2025-2-3 01:23:54 | 只看该作者
    请教是如何实现的?
    & F( h% i! N# I1 m2 w7 j: j
    ! B1 J: t8 G. b我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后,发出指令提取文件中文字,始终是文件解析中。直接在DS里问如何上传PDF文件,并提取文件中文字,照做其实是一样的。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    8#
     楼主| 发表于 2025-2-3 03:06:35 | 只看该作者
    方恨少 发表于 2025-2-3 01:23% M- J$ L& Y. U. j
    请教是如何实现的?
    9 C) r' a( U& i4 P- J0 n3 u& L1 M
    我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...

    9 m! f2 R8 `1 Z9 I  N, _$ B. d& p* g9 W  X+ Q# [$ Y2 l
    我现在也上载不了了,"upload failed",几个小时前还好好的,应该是服务又受攻击所以功能收缩了。
      E. k7 U; d. F4 l- e) k5 g; b文字之类的没问题。估计deepseek现在暂时只保证主要功能。
    ) j- f2 q8 u9 F4 [8 J美国人就这样,打不过就耍流氓,估计要等一段时间才能完全恢复。
    % A/ o' U, ?7 n8 K8 {

    点评

    给力: 5.0 涨姿势: 5.0
    给力: 5 涨姿势: 5
      发表于 2025-2-3 03:40
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    9#
     楼主| 发表于 2025-2-5 00:15:37 | 只看该作者
    方恨少 发表于 2025-2-3 01:23
    ! O7 m2 E% B% D6 j6 L& u请教是如何实现的?
    7 |7 A* o* N8 {
    : X) {5 N+ a% {/ i( s/ N我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...

    : l# b) k& B/ g( F/ I& G5 q3 {# t+ |, R6 nhttps://chat.qwenlm.ai/9 ]' K% B4 z  l  F9 Y4 |/ Z
    试一下千问,估计美国人没有攻击他,所以资源敞开用。' k) Z# m0 d: [( e9 d) E  D
    很稳定,质量不错,好像最多一次处理15页。
    7 d  d( z% s, v5 v我直接拿deepseek的指令用,没有区别。
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    10 小时前
  • 签到天数: 3118 天

    [LV.Master]无

    10#
    发表于 2025-4-16 17:01:29 | 只看该作者
    试了这个工具,可以转成markdown,正确率很高,有漏行,图片会放在一个指定的目录下。% b4 o+ j; U: I% s3 r5 ^
    处理一本100页左右的扫描版本的中文PDF,一份某行业的接口标准,纯CPU,几分钟时间。) @5 C% K7 z; `& ?" z
    这个工具不能处理表格,我把文件拖到豆包里,“把这个文件中的表格转换成 markdown。只是表格,不需要其它内容”,表格多的话,要发好多次“请继续”。
    6 N% |& p9 }4 B9 G& e- k
    - L  J/ X+ W7 r8 Yhttps://github.com/oomol-lab/pdf-craft
      T) z, V; y4 f! C$ m7 U! J
    ( s  {' \9 Q) i, F& W1. 这个工具要求装 python3.10
    - A) @: ~/ O* P2. pip install onnxruntime==1.21.0, 有英伟达的卡:pip install onnxruntime-gpu==1.21.0' \4 U3 D# r: s  t7 `% j' O* b
    3. pip install pdf-craft
    ; Z7 i2 y0 s5 t8 z" N0 B$ R) e% D8 H4. 把下面的内容写到一个文件里,例如 a.py3 y4 T6 W  J5 `# I, C8 U0 T5 @! X( }: x

    ' {) ~( {( W. z) d: N' j
    1. from pdf_craft import PDFPageExtractor, MarkDownWriter- I) x: ~, k; b* p) \
    2. + R; q% z" y  y- A; W6 M" d% |
    3. extractor = PDFPageExtractor(9 z& g1 b2 V& H6 i+ ~
    4.   device="cpu", # If you want to use CUDA, please change to device="cuda" format.
      - ]7 L/ e" e* o6 ?2 A
    5.   model_dir_path="/path/to/model/dir/path", # The folder address where the AI ​​model is downloaded and installed/ i9 J2 e' u0 O4 {+ \7 S
    6. )7 K2 @2 H* D5 g0 O2 b
    7. with MarkDownWriter(markdown_path, "images", "utf-8") as md:
      5 [6 q+ e) m3 v5 J' k6 u
    8.   for block in extractor.extract(pdf="/path/to/pdf/file"):- A3 T; s# M1 z6 r
    9.     md.write(block)
    复制代码
    % Z! Z' B" q6 Y" g# [4 m) _6 f. d2 A4 P
      J8 T4 }; O' Z9 r1 D# {5 i, h: I
    要修改的内容:
    5 l, U/ D! B: F) ]. `- m5 j4 G4.1 /path/to/model/dir/path:存放模型的路径。第一次运行这个脚本会从 huggingface.co 下一个模型,国内的要科学上网,国内的镜像上没这个模型
    . T5 q. @" W- [7 @4.2 markdown_path:输出的 markdown 路径文件名
    : J, C" J5 Z( f4.3 /path/to/pdf/file: 输入的源PDF路径文件名, O$ O6 ^) G5 `" Q

    / j1 a7 p" h2 g  `5. 运行 python3 a.py

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 1 反对 0

    使用道具 举报

    该用户从未签到

    11#
     楼主| 发表于 2025-4-16 19:47:30 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-16 19:50 编辑
    ) i- M0 X& B- C" m' J6 E' X0 ?7 F' B+ k  z
    目前为止PDF转纯文字的最佳办法。- l9 q5 D  N9 O  i" o
    先写个小程序,把PDF按章节切成小的PDF。
    9 S% C2 a/ R5 W) n& a然后,把PDF一个个传到deepseek,让她抓取,除错,输出。" P7 _9 L; W% y! s& P6 w* ?
    效果非常好。
    6 N! `( T( d: @% e  F& F! ^
    ; |9 S. q! `, x0 N( udeepseek,qwen,chatgpt 三个,deepseek是最好的。" }& \0 K8 y- k& b$ m- s1 K# ~

    2 C8 x/ H3 M1 J) W/ S( x! Ydeepseek 把页脚页眉页号全给去除干净了,跨页的段落也给你修好了。
    . v& ?) ?) A7 A/ z+ q  L而且deepseek不会加戏,chatgpt有时候会想当然的加上没有的文字,让句子看上去想那么回事。
    . r6 U% V: ]* ?- U/ N  d我曾经修一个历史文章,chatgpt给我活活加了三段,真是文豪。) k! o& d( w# n) s! J/ @5 A( {

    5 D- S0 P: U/ p6 v  h; z8 B& CAPI到目前为止,差强人意,不如网页版本修得干净。
    . x3 U8 r# Y$ {% o+ I, P/ o- a6 ^* J
    deepseek可以同时开四个。
    2 L1 G' K" F% b$ }

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    12#
    发表于 2025-4-17 12:26:23 | 只看该作者
    本帖最后由 三力思 于 2025-4-17 12:27 编辑
    3 ~* v9 O) g- P$ g! P7 p! ~/ F" P2 }# Z- F( |
    让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    13#
     楼主| 发表于 2025-4-17 16:33:20 | 只看该作者
    三力思 发表于 2025-4-17 12:26
    * q/ k4 L/ `$ J  F2 `! ]让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL ...

    $ [) [* d: M* g+ W/ B6 R细说一下,听上去很不错,多谢。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    14#
    发表于 2025-4-17 21:22:24 | 只看该作者
    nanimarcus 发表于 2025-4-17 16:33$ U0 O7 c/ e% W% Q  b7 \
    细说一下,听上去很不错,多谢。
    . m( c' }5 \3 ~" ^7 y
    直接问DS,“用C#,JAVA语言开发把PDF分成单页PDF并上传DS程序的源代码”
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    15#
     楼主| 发表于 2025-4-17 21:55:57 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-18 15:39 编辑
    5 m9 e9 F. \- {& o  F
    5 L" S: @1 c& a! D已经搞定.. h  t6 z% O$ o, v- X
    , B8 W/ f1 x% h8 I0 @2 E- P
    首先 PDF 本身已经OCR了,Adobe Acrobat Pro中自带这个功能。1 G" a( v+ G& v  V4 ?

    % h/ e, e% a. o$ C# Z1, python + pypdf 按章节拆分小的PDF$ O) y" ]; m: w$ g
    # A- e' Z+ h# R* N4 {
    2, pdftotext -enc UTF-8 -nopgbrk -eol dos input outputfile
    + V  L6 b5 A) X& ]/ h. q8 l' d6 y) Z
    得到text file
    ( H) d0 Y' T. D( U7 r4 a4 f) ~; L1 y
    9 E2 n5 i3 h4 V8 M1 _1 k3, python 读取整个outputfile,丢给deepseek 矫正。
    8 u* c8 K6 `* P  [" M" Y* ~
    & a9 l; `  {* k& m4 T1 d模型是 deepseek-chat( \' e$ E9 U8 ?( `/ _& ~) A! ~9 _

    & g  ^" n( ^( K4 {6 K) ^max_tokens 最大是 8192,别的不用改。4 M! b; W  ~$ u+ v, n
    6 b2 l! _" C$ e) W
    参考:" F  {; g4 R6 d- S& i
    https://api-docs.deepseek.com/api/create-chat-completion! d' \# B' R1 h3 L! p! V3 d% X) S2 i4 r
    2 E7 u% S( C. H
    4,费用:
    2 o. Q1 O, {$ p3 l% V" a# D! y. j' o; r1 E: }- r
    实测:
    ; M& E0 c% q, h9 ]$ e1 i% j3 z6 ]4 e2 D. w1 c
    296K 字母,用了 9 美分。( e4 n! s' B' m' v. l4 L' p, v
    ) ?6 @' X# C5 i( N# s
    英文字母 到 token 用量大约 1/31 N# ?1 w2 R: ~( B0 T

    1 V1 q* u, X. a+ f( |8 htokens: total, 11782 completion,  3729 prompt,  8053 | s:  32899
    4 \/ |% m6 O; Y/ A
    : f- Z/ g. S7 ~: a4 M7 `8 ^- u4 F32899 个字母花费 11782 tokens,包含输入输出的 tokens
    ! G) I  T7 c+ A! t. h% X( T# q! L! I+ Y/ b! H8 E$ |7 e3 t9 q, b
    价钱,非常非常便宜了。
    4 k  c% a# k: [9 r
    1 [! l! q" D. o. Y, u参考如下可以计算,懒得算了。3 Q! L- h5 `0 T! w
    % q$ q' p+ i+ A1 D3 P1 I  b/ ^0 k- H5 _
    https://api-docs.deepseek.com/quick_start/pricing9 N7 [- u3 M& L. t- \2 U2 H4 C. I

    & ?- M7 v/ }7 Z1M TOKENS INPUT (CACHE HIT)(4)                $0.07                $0.14
    " {4 |6 ^5 y& u# R& \3 u3 Y- s1M TOKENS INPUT (CACHE MISS)                  $0.27                $0.553 N' F2 V( O" s$ L
    1M TOKENS OUTPUT(5)                                              $1.10                $2.19
    6 _8 Y9 W) d, h% A7 ?& w8 v' q) V7 n* i- y5 r5 J  n& ~2 u; [# A
    5, Balance- N* j# w9 P# ^2 w
    5 N4 \2 ?. d5 }1 `- H" _" i
    可以在程序里调用,知道每次运行结束后,balance还剩多少。
    , [$ @, |9 ?4 {# U3 n$ P% E参考:
    & ]. b6 x& }' j. O6 m6 }2 lhttps://api-docs.deepseek.com/api/get-user-balance4 ?) o- |6 z- B: t% @$ j4 U/ P
    5 e& G! @: t( x) ~+ o' J
    6, Models6 J, O/ }9 v1 z, |
    8 r$ Y% u1 A$ [2 a9 D
    目前就两个6 y; `& P" i1 U% F& ]. a
    # deepseek-chat. b( D  @8 B( \( \/ e- Z3 F
    # deepseek-reasoner
    6 @' p% g1 d) ^" i6 m; K3 {1 d  K; Z$ B8 m1 ]+ {0 I5 j
    参考:: @( [! }( Y4 z- x
    https://api-docs.deepseek.com/api/list-models+ Q+ h5 T; d1 I" K% m

    ) z& o# j1 [+ C; l* E. W* E! J* B
    7, 问题
    ' v8 v9 J; L3 d9 ?- c3 y
    $ [- R3 p$ B* |$ U( @0 y2 u# u+ Edeepseek 会将前后两段合成一段。
    8 ~/ ^+ e& D) o  K& O特别是那种大量的对话的段落,deepseek会给你合成一大段。! I5 S; {/ E" A1 G, h
    $ A+ J& d6 q7 a; `6 [
    8, 钱说了算。
    ' E; S! }% H( V  R6 \* G8 s! M3 }2 g$ Z
    deepseek 如果是免费的网页版,有时候会出现超出范围的提示,不干了。
    , \/ ?- M8 b* f3 {1 A但是API就不会出现这种情况,毕竟我们给钱了。! A( e2 ^5 J5 J' n  |6 {
    chatgpt也是这样的。
    3 F+ Z. ~7 b* J7 k1 _  T2 v+ a( Z1 N8 U! U9 X; G' G
    6 ?* m- A/ v: q4 }" h

    评分

    参与人数 2爱元 +14 学识 +2 收起 理由
    唐家山 + 4
    老票 + 10 + 2 给力

    查看全部评分

    回复 支持 反对

    使用道具 举报

    手机版|小黑屋|Archiver|网站错误报告|爱吱声   

    GMT+8, 2026-7-22 10:53 , Processed in 0.066566 second(s), 18 queries , Gzip On.

    Powered by Discuz! X3.2

    © 2001-2013 Comsenz Inc.

    快速回复 返回顶部 返回列表