我正在嘗試洗掉任何可能包含非阿拉伯語字符的單詞。所以,像??b or之類的詞word應該被洗掉。
我已經設法使用以下正則運算式洗掉了非阿拉伯語字符:
re.sub(r'([^?-?] )',' ', '??b')
但是我將如何洗掉整個單詞?在正則運算式之前\b似乎不起作用。
uj5u.com熱心網友回復:
您可以使用
re.sub(r'\s*\b[\u0621-\u064A]*[^\W\d_\u0621-\u064A][^\W\d_]*\b', '', text)
\s*\b[\u0621-\u064A]*[^\W\d_\u0621-\u064A][^\W\d_]*\b比賽_
\s*- 零個或多個空格\b- 單詞邊界[\u0621-\u064A]*- 零個或多個阿拉伯字母[^\W\d_\u0621-\u064A]- 除阿拉伯字母外的任何 Unicode 字母[^\W\d_]*- 任何零個或多個 Unicode 字母\b- 單詞邊界
uj5u.com熱心網友回復:
您可能想嘗試 ascii_letters。這應該有效。
import string
text = "".join([char for char in text if char not in string.ascii_letters]).strip()
return text
轉載請註明出處,本文鏈接:https://www.uj5u.com/shujuku/411015.html
標籤:
