主頁 > 後端開發 > 利用Python-docx 讀寫 Word 檔案中的正文、表格、段落、字體等

利用Python-docx 讀寫 Word 檔案中的正文、表格、段落、字體等

2020-09-21 02:58:33 後端開發

前言:

前兩篇博客介紹了 Python 的 docx 模塊對 Word 檔案的寫操作,這篇博客將介紹如何用 docx 模塊讀取已有 Word 檔案中的資訊,

本篇博客主要內容有:

1、獲取檔案的章節資訊;
2、獲取段落文本資訊;
3、獲取表格內文本資訊;
4、獲取檔案內格式資訊,

1、獲取檔案章節資訊:

1、用docx模塊獲取已有的word檔案物件:

from docx import Document

# Document 類,不僅可以新建word檔案,也可以打開一個本地檔案
doc = Document('test03.docx')  # 想獲取的檔案檔案名,這里是相對路徑,

用做示例的 test03.docx 檔案截圖如下:

在這里插入圖片描述
檔案中有兩個章節共兩頁(一個章節一頁),一個章節的頁面為 A3 ,另一個為 A4,

2、獲取檔案章節資訊:

# 獲取檔案所有章節
sections = doc.sections
"class Sections(Sequence):"
print(sections)
# <docx.section.Sections object at 0x000000000B2E1148>
# 查看章節數量
print(len(sections)) # 2

注意:
章節物件的概念雖然比段落物件大,章節物件可以設定本章節的頁面大小頁眉頁腳等,在該章節的段落物件必須遵守該章節的設定,
但是又并不存在包含關系,也就是說不能通過章節物件獲取到段落資訊,

3、獲取頁邊距等資訊:

# 獲取章節物件的頁邊距等資訊
sec0 = sections[0]
"class Section(object):"
'''
官方解釋:檔案節,提供對節和頁面設定的訪問,
還提供對頁眉和頁腳的訪問,
'''
print(sec0)
# <docx.section.Section object at 0x000000000B2D5708>
# 獲取章節頁面資訊
# 獲取頁面邊距值:(單位為像素)
print('左邊距:',sec0.left_margin)
# 左邊距: 914400
print('右邊距:',sec0.right_margin)
# 右邊距: 914400
print('上邊距:',sec0.top_margin)
# 上邊距: 1143000
print('下邊距:',sec0.bottom_margin)
# 下邊距: 1143000
print('頁眉邊距:',sec0.header_distance)
# 頁眉邊距: 540385
print('頁腳邊距:',sec0.footer_distance)
# 頁腳邊距: 629920
print('頁面方向:',sec0.orientation)
# 頁面方向: LANDSCAPE (1)
print('頁面高度:',sec0.page_height)
# 頁面高度: 10657205
print('頁面寬度:',sec0.page_width)
# 頁面寬度: 15085695

這里獲取的是第一個章節的頁面資訊,也就是 A3 頁面的資訊,

注:上一篇博客 往Word檔案中插入圖片、表格,設定表格樣式,章節,頁眉頁腳等,在介紹設定頁面資訊時,忘記介紹如何設定頁面方向了,這里補充一下:

設定頁面方向:

# 匯入設定頁面方向所需模塊
from docx.enum.section import WD_ORIENT
# 獲取章節物件
section = document.sections[0]
# 設定頁面方向
section.orientation = WD_ORIENT.LANDSCAPE # 橫向

可設定項有橫向( LANDSCAPE ) 和縱向 ( PORTRAIT ):

'''
'PORTRAIT', 0, 'portrait', 'Portrait orientation.' 
'LANDSCAPE', 1, 'landscape', 'Landscape orientation.'
'''

檔案截圖:

在這里插入圖片描述
4、獲取檔案頁眉頁腳資訊:

head0 = sec0.header # 獲取頁眉物件
print(head0)
# <docx.section._Header object at 0x000000000B2E1348>
head0_pars = head0.paragraphs # 獲取 頁眉 paragraphs
# 獲取頁眉文字資訊
# 因存在多個 paragraph 物件的可能所以用回圈讀取的方式
head0_string = ''
for par in head0_pars:
    head0_string += par.text

print(head0_string)
# 儀征市馬集鎮總體規劃(2017-2030)——說明

# 獲取頁腳資訊,也是類似的方法
foot0 = sec0.footer
print(foot0) # 獲取頁腳物件
# <docx.section._Footer object at 0x000000000B2E3808>
foot0_pars = foot0.paragraphs
foot0_string = ''
for par in foot0_pars:
    foot0_string += par.text
print(foot0_string)
# 1

2、獲取段落文字資訊:

1、獲取Word檔案所有段落物件:

"獲取檔案所有段落資訊:"
# 獲取檔案所有段落物件
paragraphs = doc.paragraphs

注意:
paragraphs 獲取的是檔案中所有段落物件的串列,嚴格來說是word檔案中正文部分的段落物件串列,因為通過前文的介紹,許多除正文部分,如 表格,頁面頁腳等元素也包含 paragraph 物件,
而 doc.paragraphs 獲取到的 paragraph 不包含這些段落物件,

2、獲取段落物件文字資訊:

print(paragraphs)
print(len(paragraphs))  # 列印結果:20

# 獲取一個段落物件的文字資訊
par0 = paragraphs[0]
print(par0)
par0_string = par0.text
print(par0_string)

# 獲取所有段落文字資訊
pars_string = [par.text for par in paragraphs]
print(pars_string)

par0_string 列印截圖:

在這里插入圖片描述
3、獲取段落格式資訊:

print('段落對齊方式:',par0.paragraph_format.alignment)
# 段落對齊方式: LEFT (0)
print('左縮進:',par0.paragraph_format.left_indent)
# 左縮進: None
print('右縮進:',par0.paragraph_format.right_indent)
# 右縮進: None
print('首行縮進:',par0.paragraph_format.first_line_indent)
# 首行縮進: 304800
print('行間距:',par0.paragraph_format.line_spacing)
# 行間距: 1.5
print('段前間距:',par0.paragraph_format.space_before)
# 段前間距: 198120
print('段后間距:',par0.paragraph_format.space_after)
# 段后間距: 198120

LIK1

 

3、獲取文字格式資訊:

paragraph 物件 里還有更小的 run 物件,run 物件才包含了段落物件的文字資訊,
paragraph.text 方法也是通過 run 物件的方法獲取到文字資訊的:

paragraph.text 方法原始碼:

def text(self):
     text = ''
        for run in self.runs:
            text += run.text
        return text

文字的字體、大小、下劃線等資訊都包含在 run 物件中(不清楚的看前面的博客):

# 獲取段落的 run 物件串列
runs = par0.runs
print(runs)
# 獲取 run 物件
run_0 = runs[0]
print(run_0.text) # 獲取 run 物件文字資訊
# 列印結果:
# 堅持因地制宜,差異化打造特色小鎮,

檔案 段落 和 run 物件示意:

在這里插入圖片描述
獲取文字格式資訊:

# 獲取文字格式資訊
print('字體名稱:',run_0.font.name)
# 字體名稱: 宋體
print('字體大小:',run_0.font.size)
# 字體大小: 152400
print('是否加粗:',run_0.font.bold)
# 是否加粗: None
print('是否斜體:',run_0.font.italic)
# 是否斜體: True
print('字體顏色:',run_0.font.color.rgb)
# 字體顏色: FF0000
print('字體高亮:',run_0.font.highlight_color)
# 字體高亮: YELLOW (7)
print('下劃線:',run_0.font.underline)
# 下劃線: True
print('洗掉線:',run_0.font.strike)
# 洗掉線: None
print('雙洗掉線:',run_0.font.double_strike)
# 雙洗掉線: None
print('下標:',run_0.font.subscript)
# 下標: None
print('上標:',run_0.font.superscript)
# 上標: None
LIK2

注:前面的博客好像也沒介紹文字背景顏色的設定…

背景顏色設定方法: (與字體顏色設定方法有區別)

# 設定背景顏色
from  docx.enum.text import WD_COLOR_INDEX
run_2.font.highlight_color = WD_COLOR_INDEX.YELLOW

背景顏色可選值有:

'''
'AUTO', 0, 'default'
'BLACK', 1, 'black'
'BLUE', 2, 'blue'
'BRIGHT_GREEN', 4, 'green',
'DARK_BLUE', 9, 'darkBlue',
'DARK_RED', 13, 'darkRed'
'DARK_YELLOW', 14, 'darkYellow'
'GRAY_25', 16, 'lightGray'
'GRAY_50', 15, 'darkGray'
'GREEN', 11, 'darkGreen'
'PINK', 5, 'magenta'
'RED', 6, 'red'
'TEAL', 10, 'darkCyan'
'TURQUOISE', 3, 'cyan'
'VIOLET', 12, 'darkMagenta'
'WHITE', 8, 'white'
'YELLOW', 7, 'yellow'
'''LIK3

4、獲取檔案中表格資訊:

示例檔案中表格截圖:
在這里插入圖片描述
1、獲取表格樣式、單元格物件及文字資訊:

# 獲取檔案中表格資訊
tables = doc.tables # 獲取檔案中所有表格物件的串列
print(tables)
# [<docx.table.Table object at 0x000001957059CD48>]
print(len(tables)) # 查看檔案中表格數量
# 1
table0 = tables[0]  # 獲取表格物件

# 獲取表格的樣式資訊
print(table0.style)
# _TableStyle('Normal Table') id: 190621384

# 獲取一個表格的所有單元格
cells = table0._cells
print(len(cells)) # 表格中單元格數量
# 15

# 獲取單元格內所有文字資訊
cells_string = [cell.text for cell in cells]
print(cells_string)
LIK4

cells_string 列印截圖:

在這里插入圖片描述
從截圖中可以看出來,用 tableobj._cells 獲取到的單元格物件串列是按行排列的,

2、獲取表格的行列物件:

# 獲取表格物件行數量、列數量
col_num = len(table0.columns)
print(col_num) # 3
# 行數量
row_num = len(table0.rows)
print(row_num) # 5

# 獲取行物件
row0 = table0.rows[0]
# 獲取列物件
col0 = table0.columns[0]

# 獲取行物件文字資訊
'要用 row0.cells 獲取行物件的 cell 才能獲取其文字資訊'
row0_string = [cell.text for cell in row0.cells]
print(row0_string)

# 獲取列物件文字資訊
col0_string = [cell.text for cell in col0.cells]
print(col0_string)
LIK5

注:在介紹單元格格式資訊時,說過單元格內文字資訊也是通過 run 物件設定,故獲取文字資訊也和前面獲取段落文字資訊類似,就不重復講了,

結尾:

以上就是本篇博客的全部內容了,后面將會用兩個實體來將前面三篇博客的知識點串聯起來,感謝閱讀,

【Python與Office】專欄

該專欄會對 Python 的第三方模塊,如:xlwt,xlrd,python-docx等,操作 Office 辦公軟體(Word Excel PPT)的方法進行詳細講解,同時也會搭配一些實體演練,一方面強化知識點的理解與運用,另一方面也希望能起到,引導讀者進行思考:如何用 python 提高 offic 辦公軟體辦公效率的作用,

 

感興趣的朋友,可以點個 關注收藏 ,如在博客中遇到任何問題或有一些想法、需求,可留言或私信,

 

創作不易,你的支持是我最大的動力,感謝 !

轉載請註明出處,本文鏈接:https://www.uj5u.com/houduan/93480.html

標籤:Python

上一篇:python基礎

下一篇:Python基礎-函式

標籤雲
其他(157675) Python(38076) JavaScript(25376) Java(17977) C(15215) 區塊鏈(8255) C#(7972) AI(7469) 爪哇(7425) MySQL(7132) html(6777) 基礎類(6313) sql(6102) 熊猫(6058) PHP(5869) 数组(5741) R(5409) Linux(5327) 反应(5209) 腳本語言(PerlPython)(5129) 非技術區(4971) Android(4554) 数据框(4311) css(4259) 节点.js(4032) C語言(3288) json(3245) 列表(3129) 扑(3119) C++語言(3117) 安卓(2998) 打字稿(2995) VBA(2789) Java相關(2746) 疑難問題(2699) 细绳(2522) 單片機工控(2479) iOS(2429) ASP.NET(2402) MongoDB(2323) 麻木的(2285) 正则表达式(2254) 字典(2211) 循环(2198) 迅速(2185) 擅长(2169) 镖(2155) 功能(1967) .NET技术(1958) Web開發(1951) python-3.x(1918) HtmlCss(1915) 弹簧靴(1913) C++(1909) xml(1889) PostgreSQL(1872) .NETCore(1853) 谷歌表格(1846) Unity3D(1843) for循环(1842)

熱門瀏覽
  • 【C++】Microsoft C++、C 和匯編程式檔案

    ......

    uj5u.com 2020-09-10 00:57:23 more
  • 例外宣告

    相比于斷言適用于排除邏輯上不可能存在的狀態,例外通常是用于邏輯上可能發生的錯誤。 例外宣告 Item 1:當函式不可能拋出例外或不能接受拋出例外時,使用noexcept 理由 如果不打算拋出例外的話,程式就會認為無法處理這種錯誤,并且應當盡早終止,如此可以有效地阻止例外的傳播與擴散。 示例 //不可 ......

    uj5u.com 2020-09-10 00:57:27 more
  • Codeforces 1400E Clear the Multiset(貪心 + 分治)

    鏈接:https://codeforces.com/problemset/problem/1400/E 來源:Codeforces 思路:給你一個陣列,現在你可以進行兩種操作,操作1:將一段沒有 0 的區間進行減一的操作,操作2:將 i 位置上的元素歸零。最終問:將這個陣列的全部元素歸零后操作的最少 ......

    uj5u.com 2020-09-10 00:57:30 more
  • UVA11610 【Reverse Prime】

    本人看到此題沒有翻譯,就附帶了一個自己的翻譯版本 思考 這一題,它的第一個要求是找出所有 $7$ 位反向質數及其質因數的個數。 我們應該需要質數篩篩選1~$10^{7}$的所有數,這里就不慢慢介紹了。但是,重讀題,我們突然發現反向質數都是 $7$ 位,而將它反過來后的數字卻是 $6$ 位數,這就說明 ......

    uj5u.com 2020-09-10 00:57:36 more
  • 統計區間素數數量

    1 #pragma GCC optimize(2) 2 #include <bits/stdc++.h> 3 using namespace std; 4 bool isprime[1000000010]; 5 vector<int> prime; 6 inline int getlist(int ......

    uj5u.com 2020-09-10 00:57:47 more
  • C/C++編程筆記:C++中的 const 變數詳解,教你正確認識const用法

    1、C中的const 1、區域const變數存放在堆疊區中,會分配記憶體(也就是說可以通過地址間接修改變數的值)。測驗代碼如下: 運行結果: 2、全域const變數存放在只讀資料段(不能通過地址修改,會發生寫入錯誤), 默認為外部聯編,可以給其他源檔案使用(需要用extern關鍵字修飾) 運行結果: ......

    uj5u.com 2020-09-10 00:58:04 more
  • 【C++犯錯記錄】VS2019 MFC添加資源不懂如何修改資源宏ID

    1. 首先在資源視圖中,添加資源 2. 點擊新添加的資源,復制自動生成的ID 3. 在解決方案資源管理器中找到Resource.h檔案,編輯,使用整個專案搜索和替換的方式快速替換 宏宣告 4. Ctrl+Shift+F 全域搜索,點擊查找全部,然后逐個替換 5. 為什么使用搜索替換而不使用屬性視窗直 ......

    uj5u.com 2020-09-10 00:59:11 more
  • 【C++犯錯記錄】VS2019 MFC不懂的批量添加資源

    1. 打開資源頭檔案Resource.h,在其中預先定義好宏 ID(不清楚其實ID值應該設定多少,可以先新建一個相同的資源項,再在這個資源的ID值的基礎上遞增即可) 2. 在資源視圖中選中專案資源,按F7編輯資源檔案,按 ID 型別 相對路徑的形式添加 資源。(別忘了先把檔案拷貝到專案中的res檔案 ......

    uj5u.com 2020-09-10 01:00:19 more
  • C/C++編程筆記:關于C++的參考型別,專供新手入門使用

    今天要講的是C++中我最喜歡的一個用法——參考,也叫別名。 參考就是給一個變數名取一個變數名,方便我們間接地使用這個變數。我們可以給一個變數創建N個參考,這N + 1個變數共享了同一塊記憶體區域。(參考型別的變數會占用記憶體空間,占用的記憶體空間的大小和指標型別的大小是相同的。雖然參考是一個物件的別名,但 ......

    uj5u.com 2020-09-10 01:00:22 more
  • 【C/C++編程筆記】從頭開始學習C ++:初學者完整指南

    眾所周知,C ++的學習曲線陡峭,但是花時間學習這種語言將為您的職業帶來奇跡,并使您與其他開發人員區分開。您會更輕松地學習新語言,形成真正的解決問題的技能,并在編程的基礎上打下堅實的基礎。 C ++將幫助您養成良好的編程習慣(即清晰一致的編碼風格,在撰寫代碼時注釋代碼,并限制類內部的可見性),并且由 ......

    uj5u.com 2020-09-10 01:00:41 more
最新发布
  • Rust中的智能指標:Box<T> Rc<T> Arc<T> Cell<T> RefCell<T> Weak

    Rust中的智能指標是什么 智能指標(smart pointers)是一類資料結構,是擁有資料所有權和額外功能的指標。是指標的進一步發展 指標(pointer)是一個包含記憶體地址的變數的通用概念。這個地址參考,或 ” 指向”(points at)一些其 他資料 。參考以 & 符號為標志并借用了他們所 ......

    uj5u.com 2023-04-20 07:24:10 more
  • Java的值傳遞和參考傳遞

    值傳遞不會改變本身,參考傳遞(如果傳遞的值需要實體化到堆里)如果發生修改了會改變本身。 1.基本資料型別都是值傳遞 package com.example.basic; public class Test { public static void main(String[] args) { int ......

    uj5u.com 2023-04-20 07:24:04 more
  • [2]SpinalHDL教程——Scala簡單入門

    第一個 Scala 程式 shell里面輸入 $ scala scala> 1 + 1 res0: Int = 2 scala> println("Hello World!") Hello World! 檔案形式 object HelloWorld { /* 這是我的第一個 Scala 程式 * 以 ......

    uj5u.com 2023-04-20 07:23:58 more
  • 理解函式指標和回呼函式

    理解 函式指標 指向函式的指標。比如: 理解函式指標的偽代碼 void (*p)(int type, char *data); // 定義一個函式指標p void func(int type, char *data); // 宣告一個函式func p = func; // 將指標p指向函式func ......

    uj5u.com 2023-04-20 07:23:52 more
  • Django筆記二十五之資料庫函式之日期函式

    本文首發于公眾號:Hunter后端 原文鏈接:Django筆記二十五之資料庫函式之日期函式 日期函式主要介紹兩個大類,Extract() 和 Trunc() Extract() 函式作用是提取日期,比如我們可以提取一個日期欄位的年份,月份,日等資料 Trunc() 的作用則是截取,比如 2022-0 ......

    uj5u.com 2023-04-20 07:23:45 more
  • 一天吃透JVM面試八股文

    什么是JVM? JVM,全稱Java Virtual Machine(Java虛擬機),是通過在實際的計算機上仿真模擬各種計算機功能來實作的。由一套位元組碼指令集、一組暫存器、一個堆疊、一個垃圾回收堆和一個存盤方法域等組成。JVM屏蔽了與作業系統平臺相關的資訊,使得Java程式只需要生成在Java虛擬機 ......

    uj5u.com 2023-04-20 07:23:31 more
  • 使用Java接入小程式訂閱訊息!

    更新完微信服務號的模板訊息之后,我又趕緊把微信小程式的訂閱訊息給實作了!之前我一直以為微信小程式也是要企業才能申請,沒想到小程式個人就能申請。 訊息推送平臺🔥推送下發【郵件】【短信】【微信服務號】【微信小程式】【企業微信】【釘釘】等訊息型別。 https://gitee.com/zhongfuch ......

    uj5u.com 2023-04-20 07:22:59 more
  • java -- 緩沖流、轉換流、序列化流

    緩沖流 緩沖流, 也叫高效流, 按照資料型別分類: 位元組緩沖流:BufferedInputStream,BufferedOutputStream 字符緩沖流:BufferedReader,BufferedWriter 緩沖流的基本原理,是在創建流物件時,會創建一個內置的默認大小的緩沖區陣列,通過緩沖 ......

    uj5u.com 2023-04-20 07:22:49 more
  • Java-SpringBoot-Range請求頭設定實作視頻分段傳輸

    老實說,人太懶了,現在基本都不喜歡寫筆記了,但是網上有關Range請求頭的文章都太水了 下面是抄的一段StackOverflow的代碼...自己大修改過的,寫的注釋挺全的,應該直接看得懂,就不解釋了 寫的不好...只是希望能給視頻網站開發的新手一點點幫助吧. 業務場景:視頻分段傳輸、視頻多段傳輸(理 ......

    uj5u.com 2023-04-20 07:22:42 more
  • Windows 10開發教程_編程入門自學教程_菜鳥教程-免費教程分享

    教程簡介 Windows 10開發入門教程 - 從簡單的步驟了解Windows 10開發,從基本到高級概念,包括簡介,UWP,第一個應用程式,商店,XAML控制元件,資料系結,XAML性能,自適應設計,自適應UI,自適應代碼,檔案管理,SQLite資料庫,應用程式到應用程式通信,應用程式本地化,應用程式 ......

    uj5u.com 2023-04-20 07:22:35 more