Python中如何读取Word中的图片

python

Python能够快速的编写、调试,用来提取各类软件中的图片再好不过了。今天小编就为大家带来在Python中提取Word图片的方法。


方法


需要批量的修改文件后缀名,并且解压之后将图片拷贝到需要存放的地方,然后将该文件夹清空留作下次的路径,并且将文件从zip改回docx即可。(注意:doc不支持这个方法,如果需要提取doc格式的图片,可以先转为docx,再提取即可)


具体实现


1.导入相关库


'''

===========================================

 @author:  renjiaxin

 @time:    2018/8/9 0009   10:00

===========================================

'''

import zipfile

import os

import shutil


2.定义函数


为了方便和其他函数调用,直接写了个函数完成这个功能,在这里,我们需要以下四个参数:

  • word文档的路径

  • zip压缩文件的路径

  • 临时解压的tmp路径

  • 最后需要保存的store_path路径

def word2pic(path, zip_path, tmp_path, store_path):

   '''

   :param path:源文件

   :param zip_path:docx重命名为zip

   :param tmp_path:中转图片文件夹

   :param store_path:最后保存结果的文件夹(需要手动创建)

   :return:

   '''


3.重命名word文件,将后缀名docx改为zip


   # 将docx文件重命名为zip文件

   os.rename(path, zip_path)

   # 进行解压

   f = zipfile.ZipFile(zip_path, 'r')

   # 将图片提取并保存

   for file in f.namelist():

       f.extract(file, tmp_path)

   # 释放该zip文件

   f.close()


4.zip还原为docx文件,并获得图片的列表


   # 将docx文件从zip还原为docx

   os.rename(zip_path, path)

   # 得到缓存文件夹中图片列表

   pic = os.listdir(os.path.join(tmp_path, 'word/media'))


5.将图片复制到需要保存的文件夹中


并且我们将文件的名字命名为word所在的路径


  # 将图片复制到最终的文件夹中
     for  i  in  pic:

       # 根据word的路径生成图片的名称

       new_name = path.replace('', '_')

       new_name = new_name.replace(':', '') + '_' + i

       shutil.copy(os.path.join(tmp_path + '/word/media', i), os.path.join(store_path, new_name))


6.删除tmp缓冲文件夹中的文件,用以存储下一次的文件


   # 删除缓冲文件夹中的文件,用以存储下一次的文件

   for i in os.listdir(tmp_path):

       # 如果是文件夹则删除

       if os.path.isdir(os.path.join(tmp_path, i)):

           shutil.rmtree(os.path.join(tmp_path, i))


7.运行程序


if __name__ == '__main__':

   # 源文件

   path = r'E:dogcat提取图片log.docx'

   # docx重命名为zip

   zip_path = r'E:dogcat提取图片log.zip'

   # 中转图片文件夹

   tmp_path = r'E:dogcat提取图片 mp'

   # 最后保存结果的文件夹

   store_path = r'E:dogcat提取图片测试'

   m = word2pic(path, zip_path, tmp_path, store_path)


效果预览


源word



提取的图片



另附doc转docx


def doc2docx(doc_name, docx_name):

   '''

   # doc转docx

   :param doc_name: doc文档路径

   :param docx_name: docx文档路径

   :return:

   '''

   try:

       # 首先将doc转换成docx

       word = client.Dispatch("Word.Application")

       doc = word.Documents.Open(doc_name)

       # 使用参数16表示将doc转换成docx

       doc.SaveAs(docx_name, 16)

       doc.Close()

       word.Quit()

   except:

       pass


今天Python提取Word中图片的方法全部分享给大家啦,后面还有提取excel和pdf图片的方法,敬请期待。更多Python学习推荐:云海天Python教程网

以上是 Python中如何读取Word中的图片 的全部内容, 来源链接: utcz.com/z/528439.html

回到顶部