文章目录
- 七、转换 PDF 文档
-
- 7.1 将pdf文本提取为 Markdown
- 7.2 将pdf转换为word(使用`pdf2docx`库)
-
- 7.2.1 安装pdf2docx
- 7.2.2 转换所有页面
- 7.2.3 转换指定页面
- 7.2.4 多CPU核心处理
- 7.2.5 转换加密的 pdf
- 7.2.6 提取表格
- 7.2.7 pdf2docx 和 python_docx 的关系
- 7.3 PDF与图像的转换
七、转换 PDF 文档
https://pymupdf.readthedocs.io/en/latest/the-basics.html
7.1 将pdf文本提取为 Markdown
- 输出为 Markdown
为了以 Markdown 格式导出文档,您需要一个单独的帮助程序。包 pymupdf4llm 是 PyMuPDF 函数的高级包装器,它为每个页面在所有文档页面中以集成的 Markdown 格式字符串输出标准文本和表格文本:
# convert the document to markdown
import pymupdf4llm
md_text = pymupdf4llm.to_markdown("input.pdf")
# Write the text to some file in UTF8-encoding
import pathlib
pathlib