当前位置: 首页 > article >正文

Python办公自动化 获取文本数据 支持多种类型文件

学好办公自动化,走遍天下都不怕!!

        前面我们已经学习了,如何用python的下载安装以及入门基础知识,并且也知道如何使用python自动处理Excel文件数据、如何批量生成Word文件、如何对数据分析后生成洞察报告、如何用python实现自动发送包含附件的邮件等。

        今天我们主要学习python如何获取文本数据,比如获取word文件以及pdf文件的文本转换成txt类型的文件,为了方便使用,对代码进行封装,支持多种文件类型的工具。有问题请在评论区留言交流,谢谢。

目录

1. 安装下载以及导入

2.代码实现

3.运行结果

3.1 遇到一个问题

4.总结


1. 安装下载以及导入

需要的包文件都在下面了

# 导入需要的包和文件
import os,fnmatch
from win32com import client as wc
from win32com.client import Dispatch

2.代码实现

目前程序支持 doc | docx | pdf 文件类型。

1.根据文件的地址切分后得到文件的路径和文件名称

2.根据文件的后缀名生成新的txt后缀的文件名

3.设置新的保存路径 4.加载文本提取的处理程序 5.保存文件

#定义方法
#文件转换成txt文件,该方法两个参数:
#1.文件路径 需要转换的文件地址 2.保存路径 转换成txt文件之后保存的地址
def FilesToText(filePath,savePath=''):
    # 1.切分文件路径为文件目录和文件名
    dirs,filename = os.path.split(filePath)
    # print(dirs,'\n',filename)
    # return

    # 2.修改切分后文件的后缀
    typename= os.path.splitext(filename)[-1].lower() #获取文件后缀
    new_name = TranType(filename,typename)

    # print(typename,new_name)

    # 3.设置新的文件保存路径
    if savePath == '':
        savePath = dirs
    else:
        savePath = savePath
    newtxtPath = os.path.join(savePath,new_name)
    # print('!!!!',newtxtPath)   


    # 4.加载文本提取的处理程序,word 转换 txt
    wordapp = wc.Dispatch('Word.Application')
    mytxt = wordapp.Documents.Open(filePath) 
    print(filePath)  
    print(wordapp,'\n',mytxt)

    # 5.保存文本信息
    mytxt.SaveAs(newtxtPath,4) # 参数4代表抽取文本
    mytxt.Close()

def TranType(filename,typename):
    new_name = ''
    if typename == '.pdf':
        if fnmatch.fnmatch(filename,'*.pdf'):
            new_name = filename[:-4]+'.txt'
        else:return
    elif typename == '.doc' or '.docx':
        if fnmatch.fnmatch(filename,'*.doc'):
            new_name = filename[:-4]+'.txt'
        elif fnmatch.fnmatch(filename,'*.docx'):
            new_name = filename[:-5]+'.txt'            
        else:return
    else:
        print('转换失败 格式不正确无法转换')
        return
    return new_name

if __name__=='__main__':
    filePath1 = os.path.abspath(r'../demo/file/年终总结模板.doc') 
    filePath2 = os.path.abspath(r'../demo/file/2024年终总结模板.docx') 
    filePath3 = os.path.abspath(r'2023项目汇报.pdf') 
    FilesToText(filePath2)  

3.运行结果

现在我们运行项目,我们分别拿doc和docx文件、pdf文件做测试,看是否能转换成txt文件。

D:\CODE\VSCODE\python\demo> python wordtotxt.py

 

 可以看到docx和doc文件分别生成了对应的txt文件。

3.1 遇到一个问题

但是在执行pdf文件的时候出现了一个问题,Documents.Open()返回结果为none,代码以及报错截图如下图所示,经过查找filePath也是有数据的,wordapp也是有数据的,就是执行结果mytxt是none,但是执行的时候pdf文件是自动打开的,文件路径也没有问题。

 

如果小伙伴有遇到相同的问题以及解决方案,麻烦评论区留言分享一下,感谢。 

4.总结

本篇文章主要介绍了,后缀doc和docx结尾的word文件、pdf文件如何通过python转换成txt文件。

首先需要安装下载导入包、代码实现文件类型转换、最终实现文件类型的转换。


http://www.kler.cn/a/282445.html

相关文章:

  • Chrome 浏览器开启打印模式
  • 一文详细深入总结服务器选型
  • 前端无感刷新token
  • 移除元素(leetcode 27)
  • 高级计算机算法的8道题(贪心、动态规划)
  • 《Java核心技术 卷I》用户界面AWT事件继承层次
  • android MutableLiveData 赋值
  • 甲基化组学全流程生信分析教程
  • 链游开发教学
  • 项目配置在nacos配置中心进行管理
  • SK Hynix明年将开发基于96/128 GB DDR5的CXL 2.0内存解决方案
  • 深入理解Python中的装饰器链(Chaining Decorators)
  • git pull时如何避免输入用户名和密码?
  • flowable源码解读——内存缓存设计
  • 探秘紫白洋桔梗花语:勇气、爱情、希望与清晰的象征解读
  • vue前端获取电脑本机的mac和ip地址
  • 国密起步2:GmSSL3使用SM4(对称加密)
  • C语言阴阳迷宫
  • 【Python机器学习】NLP词频背后的含义——隐性语义分析
  • java 读取json文件并写入Excel
  • 【功能自动化】使用测试套件运行测试函数
  • 如何上传NPM包:一步步指南
  • Java、python、php版 剧本杀拼团服务平台 剧本杀管理系统(源码、调试、LW、开题、PPT)
  • RAG Paper List - 检索增强生成论文汇总(2)
  • 一文了解内网穿透以及内网穿透工具 Sunny-Ngrok 的使用指南
  • Java的内存管理机制之(垃圾回收(GC)原理)