xpath提取多個標籤下的text

2021-07-10 03:12:20 字數 1020 閱讀 8330

原文

主題xpath

在寫爬蟲的時候,經常會使用xpath進行資料的提取,對於如下的**:

使用xpath提取是非常方便的。假設網頁的源**在selector中:

data = selector.xpath('//div[@id="test1"]/text()').extract()[0]

然而如果遇到下面這段**呢?

id="test2">美女,
如果使用:

data = selector.xpath('//div[@id="test2"]/text()').extract()[0]

只能提取到「美女,」;

如果使用:

data = selector.xpath('//div[@id="test2"]/font/text()').extract()[0]

這還不是最糟糕的,還有第三段**:

id="test3">左,id="tiger">右,上,下。li>

ul>老牛在當中。span>

而且內部的標籤還不固定,如果我有一百段這樣類似的html**,又如何使用xpath表示式,以最快最方便的方式提取出來?

我差一點就去用正規表示式替換了。還好我去stack overflow上面提了問。於是很快就有人給我解答了。

使用xpath的string(.)

以第三段**為例:

data = selector.xpath('//div[@id="test3"]')

info = data.xpath('string(.)').extract()[0]

也可以用info = $("#test3").html();

這樣,就可以把「左,右,上,下。老牛在當中。」整個句子提取出來,賦值給info變數。

xpath提取多個標籤下的text

在寫爬蟲的時候,經常會使用xpath進行資料的提取,對於如下的 div id test1 div 使用xpath提取是非常方便的。假設網頁的源 在selector中 data selector.xpath div id test1 text extract 0 然而如果遇到下面這段 呢?div id...

xpath提取多個標籤下的text

在寫爬蟲的時候,經常會使用xpath進行資料的提取,對於如下的 div id test1 div 使用xpath提取是非常方便的。假設網頁的源 在selector中 data selector.xpath div id test1 text extract 0 然而如果遇到下面這段 呢?div id...

用xpath獲取該標籤下的所有子標籤和文字

xpath獲取該節點下 所有標籤和文字組成的字串 需要獲取子標籤以及文字內容時使用此方法,如果只是想獲取所有子標籤裡面的文字,參考另一篇部落格。from lxml import etree html 關鍵字內容 doc etree.html html msg doc.xpath div class ...