设为首页收藏本站

爱吱声

 找回密码
 注册
搜索
查看: 3951|回复: 17
打印 上一主题 下一主题

[工程技术] 利用 Deepseek 抓取PDF的文字并矫正。

[复制链接]

该用户从未签到

跳转到指定楼层
楼主
 楼主| 发表于 2025-2-2 03:35:19 | 只看该作者 回帖奖励 |倒序浏览 |阅读模式
本帖最后由 nanimarcus 于 2025-2-6 22:17 编辑 0 W! _$ t" n0 Y# D3 s* ]
6 R$ c& x3 ]: P5 l; q1 D) X" h
把PDF上传,然后让他抓取文字,并修改可能的错误。5 L9 K2 a  E1 k! o3 U* U% O3 S
然后deepseek完美的完成了任务。
0 I' M9 u3 g' A% A8 J段落清楚,列清楚,页眉页脚全部去掉。: d, A, A; _/ w& A/ S/ Z4 E4 X' h. h
我要疯掉了!
" K6 v- ~6 r6 G: p2 |3 w; s赶紧把自己那些成年老书给搬出来,deepseek,这是党和人民考验你的时候了!
- q0 ]' [& c8 F! m5 n$ O, |- d====
5 S: z6 q( N+ u. V+ T8 |# p中文也很完美。
+ c! _9 j: c" b经验值,每次十页比较稳定。
7 H+ Q- D0 t. A+ s$ C' B6 u现在我这里API还不能用,等恢复了,全自动了。, b/ T' G9 W2 x- I
====
2 z# u/ E: c: a  F' o( K第二次疯掉了!
7 L1 J; S) B, d我上传英文文件后,让他抓取文字,矫正,然让他按页划分,前面放英文,后面放中文,结果仍然完美。
9 F1 Z  H' g1 o) N9 Y  S/ |====' x8 U, R6 X: D( t1 x6 A8 d
现在我让他从PDF抓取文字,矫正后,按段落翻译,可以一次翻译多个段落,每次翻译不超过一个固定数目,结果仍然完美。
6 a  O4 q+ t& v1 h9 g3 ]但是任务多了后,每次翻译的页面数是减少的。( A( R. e' W3 O6 @% l3 k1 w
好吧,我五体投地,继续探索。
4 M# m) h* f1 I' Z5 X9 G====
4 ^- R1 N$ Z2 D: i为了防止中间结束,可以告诉他必须所有页面全部处理完就可以了,我现在是应该佩服我自己呢还是应该佩服 deepseek 呢,抑或都佩服。
, U1 |; q; Q8 `, W====2 h7 g* t0 B: e* i' g3 {# q
好吧,有些东西是不给翻译的,哈哈。
/ d9 n1 h, g. I( j2 A  S! R" x& M: b+ r# R
Sorry, that's beyond my current scope. Let’s talk about something else.
; u- o: M' x# `+ r) h====
) ~; D5 I5 H5 k3 M! \- K然后我的英文命令也让deepseek 帮我修改,呵呵。
3 s1 i- f  m) H- ~3 @! u6 F====
8 Y0 ?( c8 }( }8 T9 y日语的文本他也可以处理,过程一模一样的。问题也是一模一样的,假名太多,汉字很少,我不懂日语,翻出来都不知道对不对。
2 h$ I, g( E. D1 D====
1 ]5 t. U5 I! u6 k9 ^3 d时间段的话,北京时间的下午和晚上用比较好。1 w& W6 v* \% P8 M+ s. v
后半夜和早上,美国人上班了,要么在用,要么在黑客攻击。9 R7 Y0 }8 R. H- h  x
====
& {) H6 Y4 n& L3 ~3 x+ h用千问吧,非常稳定,非常强大。1 ]% @2 o9 y5 `; Y- g8 v
https://chat.qwenlm.ai/
$ _1 ?1 J+ Z( a+ w8 j====
8 D3 S% `# L: {. x# LDeepseek,API 看上去可用了,但是不给充钱。4 N9 V6 K# O! Q5 Q

' j+ f9 B) X7 |, _- `7 a) Y/ Q5 h8 x/ B6 f0 r: c0 j# p

1 ?4 p% p, l/ b2 M; R! ~, Z

评分

参与人数 11爱元 +102 学识 +2 收起 理由
testjhy + 10
johnsonjian + 10
helloworld + 10
laser + 10
笑羽 + 10

查看全部评分

  • TA的每日心情
    开心
    12 小时前
  • 签到天数: 3912 天

    [LV.Master]无

    沙发
    发表于 2025-2-2 03:53:32 | 只看该作者
    这功能很赞呀

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    板凳
     楼主| 发表于 2025-2-2 03:56:21 | 只看该作者
    马鹿 发表于 2025-2-2 03:53$ d# s! \* j2 Y) O( @
    这功能很赞呀

    , _( b* q, G7 K& b简直太赞了,我现在正在思考还有什么工作需要 deepseek 干的,现在的上限是我的上限,不是 deepseek 的上限。

    点评

    给力: 5.0 油墨: 5.0
    油菜: 5.0
    油墨: 5 油菜: 5
      发表于 2025-2-2 08:23
    给力: 5
      发表于 2025-2-2 04:41

    评分

    参与人数 2爱元 +20 收起 理由
    笑羽 + 10
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情

    2022-1-1 00:00
  • 签到天数: 793 天

    [LV.10]大乘

    地板
    发表于 2025-2-2 04:13:28 | 只看该作者
    有没有上传整本书试试
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    5#
     楼主| 发表于 2025-2-2 04:27:15 | 只看该作者
    indy 发表于 2025-2-2 04:13
      o! v  \! T  x, B" ?$ U* Q- E有没有上传整本书试试
    1 E  N! |/ {1 }* [$ G  t1 X7 @) N
    目前看来,差不多十页左右就停止了,看看还有什么诀窍不。

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10 谢谢分享

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    12 小时前
  • 签到天数: 3912 天

    [LV.Master]无

    6#
    发表于 2025-2-2 04:41:51 | 只看该作者
    本帖最后由 马鹿 于 2025-2-1 15:43 编辑 , D: G  s1 O2 q. x) \8 |

    , t7 d1 r, R) K- s8 U1 A# V/ v以后让deepseek 读出土的竹简
    : v9 o8 |! p4 K$ w' n2 q2 ?: {" @" c- j0 H/ Q/ N
    还有把古文翻译成现代白话
    9 a0 {  d) s; v: M
    1 |/ D  @; k& h% K. G8 K. O以后不认识的字不查字典了, 直接问deepseek
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    奋斗
    前天 18:59
  • 签到天数: 3067 天

    [LV.Master]无

    7#
    发表于 2025-2-3 01:23:54 | 只看该作者
    请教是如何实现的?
    3 D% a, t' F" _2 w) T% [& s: S1 g5 a
    ( f, k. H. R& D我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后,发出指令提取文件中文字,始终是文件解析中。直接在DS里问如何上传PDF文件,并提取文件中文字,照做其实是一样的。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    8#
     楼主| 发表于 2025-2-3 03:06:35 | 只看该作者
    方恨少 发表于 2025-2-3 01:23- o# @" ^. q2 o& @) W$ @! k
    请教是如何实现的?) x( F2 i- [& T3 ~; o$ `1 s

    2 \; @7 k% `  [  B& i3 R$ b我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...
    " R  P& A* y. ^" c6 C( w' n8 D7 D
    5 K; r4 ~( s) k0 p# K' i  u+ |
    我现在也上载不了了,"upload failed",几个小时前还好好的,应该是服务又受攻击所以功能收缩了。
    8 o2 B( T7 Q" \0 q文字之类的没问题。估计deepseek现在暂时只保证主要功能。9 j* R" m0 F: W7 V0 D! F2 Q$ ?& [
    美国人就这样,打不过就耍流氓,估计要等一段时间才能完全恢复。
    3 [; l/ X6 K) g1 Y6 E0 Q

    点评

    给力: 5.0 涨姿势: 5.0
    给力: 5 涨姿势: 5
      发表于 2025-2-3 03:40
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    9#
     楼主| 发表于 2025-2-5 00:15:37 | 只看该作者
    方恨少 发表于 2025-2-3 01:231 S3 s1 D; o, D9 [
    请教是如何实现的?# ?" x: \! |% z* D& w4 y
    2 {+ y  W/ j/ Y5 l& \8 q' u
    我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...

    % b8 n9 @7 P. G. M# T, w) Shttps://chat.qwenlm.ai/
    0 Y* v4 a4 p; B6 v( w5 {+ E试一下千问,估计美国人没有攻击他,所以资源敞开用。
    & M: O4 L1 U; r% u很稳定,质量不错,好像最多一次处理15页。
    1 w' l# z  N# @. O' l6 Z" ^" u$ O我直接拿deepseek的指令用,没有区别。
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    12 小时前
  • 签到天数: 3174 天

    [LV.Master]无

    10#
    发表于 2025-4-16 17:01:29 | 只看该作者
    试了这个工具,可以转成markdown,正确率很高,有漏行,图片会放在一个指定的目录下。
    - m* l3 n* v' K- x1 H5 W) s处理一本100页左右的扫描版本的中文PDF,一份某行业的接口标准,纯CPU,几分钟时间。7 k  d* J  F6 M9 s5 i6 T0 g7 K8 o9 M
    这个工具不能处理表格,我把文件拖到豆包里,“把这个文件中的表格转换成 markdown。只是表格,不需要其它内容”,表格多的话,要发好多次“请继续”。
    * _: v! X0 V2 e6 R$ G1 h& v' m" k: x; J- U. {; b+ r
    https://github.com/oomol-lab/pdf-craft
    " ~7 O9 h' j/ }) |) a' B5 [: K$ ]2 W% C$ v8 N
    1. 这个工具要求装 python3.10$ `# M2 q6 |- g5 \" z4 T
    2. pip install onnxruntime==1.21.0, 有英伟达的卡:pip install onnxruntime-gpu==1.21.0* |& U$ ^9 h+ T( B1 ]
    3. pip install pdf-craft
    . S6 F6 p3 i, _# x6 a% @# G0 V4. 把下面的内容写到一个文件里,例如 a.py& G0 w0 @. x& z: X  O, \
    ' R4 v- H( I: N+ @0 Q  h
    1. from pdf_craft import PDFPageExtractor, MarkDownWriter5 L" z  g. X& I  H

    2. 5 r% e, f1 B8 F% p
    3. extractor = PDFPageExtractor(; Z3 @/ _. T) C6 t* S* G
    4.   device="cpu", # If you want to use CUDA, please change to device="cuda" format.
      # L' S& A% E# K8 D7 d& j' {; X
    5.   model_dir_path="/path/to/model/dir/path", # The folder address where the AI ​​model is downloaded and installed1 ^) |+ R: T, G; q: o5 d/ V: I
    6. )
      3 ~* Y9 H7 y% {2 Q$ `" C
    7. with MarkDownWriter(markdown_path, "images", "utf-8") as md:
      ) z' M/ m1 H% B0 s
    8.   for block in extractor.extract(pdf="/path/to/pdf/file"):
      ; M% G5 t/ O  P7 j' _+ U9 L
    9.     md.write(block)
    复制代码
    1 R5 n+ M' l; F1 I6 b$ @' a  K
    * Y3 m8 V) u" E
    要修改的内容:, t. h" L( Y8 @0 x
    4.1 /path/to/model/dir/path:存放模型的路径。第一次运行这个脚本会从 huggingface.co 下一个模型,国内的要科学上网,国内的镜像上没这个模型7 J* {& `& c+ g. j
    4.2 markdown_path:输出的 markdown 路径文件名1 G% t; {. c& n: L" `
    4.3 /path/to/pdf/file: 输入的源PDF路径文件名
    1 \4 }! W+ P: h1 q
    % ~4 a4 q2 @* v5. 运行 python3 a.py

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 1 反对 0

    使用道具 举报

    该用户从未签到

    11#
     楼主| 发表于 2025-4-16 19:47:30 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-16 19:50 编辑 ) W8 I0 r: v9 w6 I( {6 D

    3 v3 t0 c: r5 X7 B目前为止PDF转纯文字的最佳办法。
    7 z# J  l  v' y6 o  _* v先写个小程序,把PDF按章节切成小的PDF。  j" x& F0 B, n; D& u% h/ s
    然后,把PDF一个个传到deepseek,让她抓取,除错,输出。
    $ x1 S/ u5 d3 C6 \! x3 x4 f5 }效果非常好。# y& g* }6 @, [7 u- {" M

    " T' p  u) M( O# ~/ D  K8 {deepseek,qwen,chatgpt 三个,deepseek是最好的。' K% X7 M! G( x1 y7 i
    / F2 f+ v) p* h; c: C# _
    deepseek 把页脚页眉页号全给去除干净了,跨页的段落也给你修好了。) B9 v$ t! Q7 i) Q
    而且deepseek不会加戏,chatgpt有时候会想当然的加上没有的文字,让句子看上去想那么回事。1 y: w8 }$ Z/ \; k8 ]4 B' F
    我曾经修一个历史文章,chatgpt给我活活加了三段,真是文豪。/ G, h& O( m5 u8 S2 R

    & Y+ p3 L$ R# H* J( xAPI到目前为止,差强人意,不如网页版本修得干净。" ~" D3 u! J  a) Z' Y

    ! \" Y# u' U5 q: p6 |( s4 ^( pdeepseek可以同时开四个。0 `" P9 o9 g0 c1 ]5 Z; f* ^# k+ U

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    12#
    发表于 2025-4-17 12:26:23 | 只看该作者
    本帖最后由 三力思 于 2025-4-17 12:27 编辑 ; }+ F4 _) Z3 ?% w/ i  ^2 I

    " I; [: [/ A  {7 {0 h让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    13#
     楼主| 发表于 2025-4-17 16:33:20 | 只看该作者
    三力思 发表于 2025-4-17 12:26
    ( ~1 e/ B  s# k" p- a8 L3 A让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL ...

    * K; J; G5 t, N4 B: Z细说一下,听上去很不错,多谢。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    14#
    发表于 2025-4-17 21:22:24 | 只看该作者
    nanimarcus 发表于 2025-4-17 16:33" i1 p+ p+ b4 U- G
    细说一下,听上去很不错,多谢。
    " j9 [% w5 D% z( r& v  n$ n
    直接问DS,“用C#,JAVA语言开发把PDF分成单页PDF并上传DS程序的源代码”
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    15#
     楼主| 发表于 2025-4-17 21:55:57 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-18 15:39 编辑 3 u, D3 A0 i8 j) l  W
    6 j  L0 c8 X9 s) [" P# }2 f( ?# W* E
    已经搞定.
    0 q0 y: K" E1 y# E' p
    9 ]) y, z" }2 V首先 PDF 本身已经OCR了,Adobe Acrobat Pro中自带这个功能。
    ; `, i( ~5 E; M) ~7 b* G% F
    ( i) @' h3 F  \! w1, python + pypdf 按章节拆分小的PDF
    / J8 a: `' O( l! ~9 W* F3 b! `7 [8 k& H: [/ [2 N; |
    2, pdftotext -enc UTF-8 -nopgbrk -eol dos input outputfile
    2 R6 U' e9 b2 {- E# r( I& O5 V. p
    , H  f, t  d4 j得到text file! g4 P: i4 S; S
    4 D8 u5 h2 O4 g- @, X
    3, python 读取整个outputfile,丢给deepseek 矫正。4 i. x; Z6 b5 c6 E2 c1 @  o; e
    , R9 L- q$ p9 j, D" v, r
    模型是 deepseek-chat
    ! D) @" I7 [2 I1 d+ P' T" t
    $ a/ y" V2 }( umax_tokens 最大是 8192,别的不用改。  d0 ^* z: d5 B, C' I8 P

    ' J% c2 c( [1 m& W4 I) \1 n1 [/ g& U参考:
    ! R" A0 I' Y) u9 Uhttps://api-docs.deepseek.com/api/create-chat-completion2 d/ O1 P4 B! y& u& @8 u3 {

      Q7 E# ~* |7 c" J0 w" s4,费用:. E: b. a; G, f. Y
    2 J' A. j9 r& }' f7 p/ w3 d8 Y
    实测:" F$ a! f! r+ k& k% L) a4 x
    * @0 m( a3 L0 H+ M- N+ {+ m3 M
    296K 字母,用了 9 美分。
    # N9 V5 p; A& |, ^; P; F& t1 X: e
    2 }4 P6 Z6 H9 F. F. N+ p: N英文字母 到 token 用量大约 1/3
    4 J7 b) ~% ]( S: M6 I  M# T+ V3 J6 E: Z0 C9 r+ X# T
    tokens: total, 11782 completion,  3729 prompt,  8053 | s:  32899
    3 n( ]/ r, Q( [# _! w7 p, x5 N, Q6 c, E+ p( |% l" X2 B/ Q3 R
    32899 个字母花费 11782 tokens,包含输入输出的 tokens
    4 e+ N) c  D9 B4 C# v, K: t5 R
    * B2 G+ j$ w) f% ~- B价钱,非常非常便宜了。
    7 o# L1 @: e# E* _0 W5 k/ Z4 J8 I/ Q
      p! [! Q8 |' E, s% J+ S参考如下可以计算,懒得算了。7 [: ^) Y2 q+ ?" @

      c- w- b# G) ?https://api-docs.deepseek.com/quick_start/pricing
    . L4 h- X' F8 }/ p9 I$ l
    3 r6 B7 y; |) |1M TOKENS INPUT (CACHE HIT)(4)                $0.07                $0.14* K1 L/ L, E  ?
    1M TOKENS INPUT (CACHE MISS)                  $0.27                $0.55
    & T* o7 l" S" w' r, A0 T1M TOKENS OUTPUT(5)                                              $1.10                $2.19
    ' ^* J7 H: Q3 z" K" A
    0 N( f; f6 G& W, s1 [2 D5, Balance
      A' {: F9 B2 ^  O7 i! L
    9 [+ B0 g3 Y1 F  @6 X( _- h可以在程序里调用,知道每次运行结束后,balance还剩多少。
    0 z4 h' J3 X0 e4 O; G  {参考:9 Q9 a9 @5 i: [# D2 d0 P
    https://api-docs.deepseek.com/api/get-user-balance
    9 t9 r* ]' _% q1 G8 ], ?) W, s7 Q$ [; u
    6, Models  r; y) {' u# y/ x' t; t
    " y* `) k* c& t4 U" x
    目前就两个
    4 M# P' l! V: c# deepseek-chat
    $ G2 y& J% S$ `4 f# deepseek-reasoner
    + f5 ^! E5 @7 ^, ?) X* T; u0 z7 t: }2 ^, A+ X$ w* \3 Q$ ?
    参考:
    ) b  ^% O% a. l8 }" s0 s! A* F6 g# Ghttps://api-docs.deepseek.com/api/list-models
    1 k' z& i2 d; ]$ }7 U; ?5 u) _1 d+ b+ u& V
    4 V% ~, q: Y5 A7 H" f
    7, 问题5 Y) m0 E* h' w: S5 F- [6 u

    ) ?" ]- e( @1 |" Jdeepseek 会将前后两段合成一段。
    1 ^% W' Q: i( t9 j" o0 T特别是那种大量的对话的段落,deepseek会给你合成一大段。
    6 ?0 r% J* H1 e
    8 N5 ~9 e$ a% ]% P' |6 B8, 钱说了算。' k+ V5 l- R( k' s) o' D

    + f6 `1 A4 v, g% Ddeepseek 如果是免费的网页版,有时候会出现超出范围的提示,不干了。
      S9 [% T: F5 I. J" D% L但是API就不会出现这种情况,毕竟我们给钱了。
    + {$ i7 E$ ~7 b( K1 a) jchatgpt也是这样的。
    / B2 l. L8 M: C; [8 x; g7 [4 J& {( C5 T1 d% s) `7 [9 b
    4 F5 N* B; @, ^$ o

    评分

    参与人数 2爱元 +14 学识 +2 收起 理由
    唐家山 + 4
    老票 + 10 + 2 给力

    查看全部评分

    回复 支持 反对

    使用道具 举报

    手机版|小黑屋|Archiver|网站错误报告|爱吱声   

    GMT+8, 2026-9-21 12:18 , Processed in 0.066658 second(s), 18 queries , Gzip On.

    Powered by Discuz! X3.2

    © 2001-2013 Comsenz Inc.

    快速回复 返回顶部 返回列表