我正在嘗試使用 R 中的 Rvest 從 html 檔案中洗掉表格。但是 html_node 不起作用,我認為這是因為西班牙語中的 xpath es 中的 id 并且有口音。
這是代碼:
library(rvest)
library(xml2)
url <- "https://www3.ine.gub.uy/boletin/Boletin Ingresos 4to trimestre 2021.html"
html <- read_html(url)
data <- html_node(html, xpath='//*[@id="ingreso-medio-per-cápita"]/table/tbody')
我一直在谷歌搜索,但我找不到解決方案。如果有人可以幫助我,我將不勝感激!
uj5u.com熱心網友回復:
我不確定這里的問題是什么,但由于重音字符之前的字串仍然是唯一的,您可以使用 xpath 函式獲取它starts-with
library(rvest)
library(xml2)
url <- "https://www3.ine.gub.uy/boletin/Boletin Ingresos 4to trimestre 2021.html"
html <- read_html(url)
xpath <- '//div[starts-with(@id,"ingreso-medio-per-c")]/table'
data <- html_table(html_nodes(html, xpath = xpath))[[1]][1:3,]
#> Warning in table_fill(cells, trim = trim): NAs introduced by coercion
data
#> # A tibble: 3 x 3
#> `` `Trimestre 3 2021` `Trimestre 4 2021`
#> <chr> <dbl> <dbl>
#> 1 Total país 25.8 26.6
#> 2 Montevideo 32.5 33.5
#> 3 Interior 21.5 22.3
由reprex 包于 2022-02-15 創建(v2.0.1)
uj5u.com熱心網友回復:
或者你可以使用,
library(rvest)
library(tidyverse)
url = 'https://www3.ine.gub.uy/boletin/Boletin%20Ingresos%204to%20trimestre%202021.html'
url %>%
read_html() %>%
html_table()
從網頁獲取所有表格。
轉載請註明出處,本文鏈接:https://www.uj5u.com/caozuo/426945.html
上一篇:在網頁抓取期間元素點擊(或)href鏈接自動點擊網頁后抓取資料
下一篇:網頁抓取時使用熊貓的值錯誤
