C#用xpath查找某节点如何写_框架

你这个问题应该至少把xml的整体的结构写出来，别人才好给你解答的。要知道从根节点一直下来的相对路径才能确定Xpath的写法。

/root/<节点1>/<节点2>//<@属性>

Xpath是功能很强大的，但是也是相对比较复杂的一门技术，最好还是到博客园上面去专门找一些专业的帖子来看一看，下面是一些简单的Xpath语法和一个实例，提供给你参考一下

<title>Empire Burlesque</title>

<artist>Bob Dylan</artist>

</cd>

<title>Hide your heart</title>

<artist>Bonnie Tyler</artist>

</cd>

<title>Greatest Hits</title>

<artist>Dolly Parton</artist>

</cd>

</catalog>

定位节点

XML是树状结构，类似档案系统内数据夹的结构，XPath也类似档案系统的路径命名方式。不过XPath 是一种模式(Pattern)，可以选出 XML档案中，路径符合某个模式的所有节点出来。例如要选catalog底下的cd中所有price元素可以用：

/catalog/cd/price

如果XPath的开头是一个斜线（/）代表这是绝对路径。如果开头是两个斜线（//）表示文件中所有符合模式的元素都会被选出来，即使是处于树中不同的层级也会被选出来。以下的语法会选出文件中所有叫做cd的元素（在树中的任何层级都会被选出来）：

//cd

选择未知的元素

使用星号（Wildcards,＊）可以选择未知的元素。下面这个语法会选出/catalog/cd 的所有子元素：

/catalog/cd/

以下的语法会选出所有catalog的子元素中，包含有price作为子元素的元素。

/catalog//price

以下的语法会选出有两层父节点，叫做price的所有元素。

///price

以下的语法会选择出文件中的所有元素。

要注意的是，想要存取不分层级的元素，XPath语法必须以两个斜线开头(//)，想要存取未知元素才用星号()，星号只能代表未知名称的元素，不能代表未知层级的元素。

选择分支

使用中括号可以选择分支。以下的语法从catalog的子元素中取出第一个叫做cd的元素。XPath的定义中没有第0元素这种东西。

/catalog/cd[1]

以下语法选择catalog中的最后一个cd元素：（XPathj并没有定义 first() 这种函式喔，用上例的 [1]就可以取出第一个元素。

/catalog/cd[last()]

以下语法选出含有price子元素的所有/catalog/cd元素。

/catalog/cd[price]

以下语法选出price元素的值等于1090的所有/catalog/cd元素

/catalog/cd[price=1090]

以下语法选出price元素的值等于1090的所有/catalog/cd元素的price元素

/catalog/cd[price=1090]/price

选择一个以上的路径

使用Or *** 作数(|)就可以选择一个以上的路径。例如：

/catalog/cd/title | catalog/cd/artist

选择所有title以及artist元素

//title | //artist

选择所有title以及artist以及price元素

//title | //artist | //price

选择属性

在XPath中，除了选择元素以外，也可以选择属性。属性都是以@开头。例如选择文件中所有叫做country的属性：

//@country

选择所有含有country这个属性的cd元素：

//cd[@country]

以下语法选择出含有属性的所有cd元素

//cd[@]

以下语法选择出country属性值为UK的cd元素

//cd[@country='UK']

1、鼠标指到发表时间上，右键点击审查元素

2、鼠标放在d出来的蓝色区域上，右键点击copy xpath

3、粘贴得到xpath，后面加上'/title'，就是提取时间的xpath

//[@id="v6_pl_content_homefeed"]/div[1]/div[2]/div[1]/div[1]/div[3]/div[5]/a[1]/title

1 利用Selenium IDE

我们可以通过firefox添加插件Selenium IDE并开启。当点击红色的录制按钮后，我们对网页进行 *** 作后，该工具会录制所有的行为并转化为selenium命令，当然也就包含有了locator。

方法优点：简单、方便

方法不足：对于一些复杂点的行为可能会漏掉，因此也就无法捕获相应的locator；此外locator是自动获取的，可能不是很直观，另外无法得到统一样式的locator。

2 利用Firebug

同样firefox的插件中可以添加firebug。在Tools->Web Developer->Firebug中打开Firebug，于是能够看到页面的下半部分有显示Firebug窗口，可以查看HTML，CSS等。因为了解的粗浅，所以只能说说知道的几点简单功能。

如果我们需要查看页面某个元素的locator，可以鼠标右击，选择Inspect Element with Firebug, 于是就到了元素对应的html源码位置。这样我们根据这部分源码来写locator。

但是，往往对于一些element如button等，右击后没有反应时，我们可以考虑选择它们旁边的元素进行，到源码后再通过查找其兄弟元素源码或者上一层来找到相应源码。这里主要根据是当我们鼠标放在以某tag为根节点的源码的上时，上面的页面对应的界面元素会有相应标记。

方法缺点：写出的locator可能并不是页面的唯一，这样selenium运行就难以识别

使用时先安装 lxml 包

开始使用 #

和beautifulsoup类似，首先我们需要得到一个文档树

把文本转换成一个文档树对象

from lxml import etreeif __name__ == '__main__':doc='''

把文件转换成一个文档树对象

fromlxmlimportetree# 读取外部文件 indexhtmlhtml = etreeparse('/indexhtml')result = etreetostring(html, pretty_print=True)#pretty_print=True 会格式化输出print(result)

均会打印出文档内容

节点、元素、属性、内容 #

xpath 的思想是通过路径表达去寻找节点。节点包括元素，属性，和内容

元素举例

html --->div --->

这里我们可以看到，这里的元素和html中的标签一个意思。单独的元素是无法表达一个路径的，所以单独的元素不能独立使用

路径表达式 #

/ 根节点，节点分隔符，// 任意位置当前节点父级节点@ 属性

通配符 #

任意元素@ 任意属性node() 任意子节点（元素，属性，内容)

谓语 #

使用中括号来限定元素，称为谓语

//a[n] n为大于零的整数，代表子元素排在第n个位置的元素//a[last()] last() 代表子元素排在最后个位置的元素//a[last()-] 和上面同理，代表倒数第二个//a[position()<3] 位置序号小于3，也就是前两个，这里我们可以看出xpath中的序列是从1开始//a[@href] 拥有href的元素//a[@href='内置很多函数。更多函数查看 >

以上就是关于C#用xpath查找某节点如何写全部的内容，包括:C#用xpath查找某节点如何写、关于python，xpath采集过微博数据的问题、如何获取网页元素的xpath等相关内容解答，如果想了解更多相关内容，可以关注我们，你们的支持是我们更新的动力！

欢迎分享，转载请注明来源：内存溢出

原文地址: http://outofmemory.cn/web/9817792.html

C#用xpath查找某节点如何写

发表评论

评论列表（0条）