使用 Python 的 'python-pptx' 库可以提取 '.pptx' 文件的文字,但对于 '.ppt' 文件,需要使用 'python-docx' 库来读取其中的文本内容。

以下是一个简单的示例代码,用于读取 '.ppt' 文件中的文本内容:

from pptx import Presentation
from docx import Document

# 打开PPT文件
ppt_file = 'example.ppt'
ppt = Presentation(ppt_file)

# 创建一个新的Word文档
doc = Document()

# 遍历每个幻灯片,提取文本内容
for slide in ppt.slides:
    # 遍历每个形状(shape)对象
    for shape in slide.shapes:
        # 如果形状是文本框(textbox)类型
        if shape.has_text_frame:
            # 提取文本内容
            text = shape.text
            # 将文本内容写入Word文档
            doc.add_paragraph(text)

# 保存Word文档
doc_file = 'example.docx'
doc.save(doc_file)

在这个示例代码中,我们首先打开 '.ppt' 文件,然后使用 for 循环遍历每个幻灯片和每个形状对象。如果形状是文本框类型,我们就提取其中的文本内容,并将其写入一个新的 Word 文档中。最后,我们将 Word 文档保存到磁盘上。

请注意,这只是一个简单的示例代码,实际应用中可能需要更复杂的代码来处理更复杂的 '.ppt' 文件。

Python 提取 .ppt 文件文字:使用 python-docx 库

原文地址: https://www.cveoy.top/t/topic/oRmb 著作权归作者所有。请勿转载和采集!

免费AI点我,无需注册和登录