pythonetree解析xml

發布時間: 2022-08-27 06:09:11

『壹』 python編寫一個程序以嘗試解析XML/HTML標簽.

要給這段文字添加一個 root 標簽，然後對裡面的 node 進行遍歷。root 標簽的名字可以任意定（但是必須添加一個），我這里使用的 root 命名，對於其它的名字也一樣。如果你是直接讀取的 XML 文件，而不是字元串，可以將文件打開，然後把文件句柄傳入 ElementTree.parse() 函數，最後對其返回值進行遍歷。

fromxml.etreeimportElementTree
parsed=ElementTree.XML('''<root>
<composer>WolfgangAmadeusMozart</composer><author>SamuelBeckett</author><city>London</city>
</root>''')
outstr=[]
fornodeinparsed:
outstr+=['%s:%s'%(node.tag,node.text)]
print(''.join(outstr))

『貳』如何用python讀取xml文件

一、簡介

XML（eXtensible Markup Language）指可擴展標記語言，被設計用來傳輸和存儲數據，已經日趨成為當前許多新生技術的核心，在不同的領域都有著不同的應用。它是web發展到一定階段的必然產物，既具有SGML的核心特徵，又有著HTML的簡單特性，還具有明確和結構良好等許多新的特性。
python解析XML常見的有三種方法：一是xml.dom.*模塊，它是W3C DOM API的實現，若需要處理DOM API則該模塊很適合，注意xml.dom包裡面有許多模塊，須區分它們間的不同；二是xml.sax.*模塊，它是SAX API的實現，這個模塊犧牲了便捷性來換取速度和內存佔用，SAX是一個基於事件的API，這就意味著它可以「在空中」處理龐大數量的的文檔，不用完全載入進內存；三是xml.etree.ElementTree模塊（簡稱 ET），它提供了輕量級的Python式的API，相對於DOM來說ET 快了很多，而且有很多令人愉悅的API可以使用，相對於SAX來說ET的ET.iterparse也提供了「在空中」的處理方式，沒有必要載入整個文檔到內存，ET的性能的平均值和SAX差不多，但是API的效率更高一點而且使用起來很方便。
二、詳解

解析的xml文件（country.xml）：
在CODE上查看代碼片派生到我的代碼片

<?xml version="1.0"?>
<data>
<country name="Singapore">
<rank>4</rank>
<year>2011</year>
<gdppc>59900</gdppc>
<neighbor name="Malaysia" direction="N"/>
</country>
<country name="Panama">
<rank>68</rank>
<year>2011</year>
<gdppc>13600</gdppc>
<neighbor name="Costa Rica" direction="W"/>
<neighbor name="Colombia" direction="E"/>
</country>
</data>

1、xml.etree.ElementTree

ElementTree生來就是為了處理XML，它在Python標准庫中有兩種實現：一種是純Python實現的，如xml.etree.ElementTree，另一種是速度快一點的xml.etree.cElementTree。注意：盡量使用C語言實現的那種，因為它速度更快，而且消耗的內存更少。
在CODE上查看代碼片派生到我的代碼片

try:
import xml.etree.cElementTree as ET
except ImportError:
import xml.etree.ElementTree as ET

這是一個讓Python不同的庫使用相同API的一個比較常用的辦法，而從Python 3.3開始ElementTree模塊會自動尋找可用的C庫來加快速度，所以只需要import xml.etree.ElementTree就可以了。
在CODE上查看代碼片派生到我的代碼片

#!/usr/bin/evn python
#coding:utf-8

try:
import xml.etree.cElementTree as ET
except ImportError:
import xml.etree.ElementTree as ET
import sys

try:
tree = ET.parse("country.xml") #打開xml文檔
#root = ET.fromstring(country_string) #從字元串傳遞xml
root = tree.getroot() #獲得root節點
except Exception, e:
print "Error:cannot parse file:country.xml."
sys.exit(1)
print root.tag, "---", root.attrib
for child in root:
print child.tag, "---", child.attrib

print "*"*10
print root[0][1].text #通過下標訪問
print root[0].tag, root[0].text
print "*"*10

for country in root.findall('country'): #找到root節點下的所有country節點
rank = country.find('rank').text #子節點下節點rank的值
name = country.get('name') #子節點下屬性name的值
print name, rank

#修改xml文件
for country in root.findall('country'):
rank = int(country.find('rank').text)
if rank > 50:
root.remove(country)

tree.write('output.xml')

運行結果：

三、總結
（1）Python中XML解析可用的類庫或模塊有xml、libxml2 、lxml 、xpath等，需要深入了解的還需參考相應的文檔。
（2）每一種解析方式都有自己的優點和缺點，選擇前可以綜合各個方面的性能考慮。
（3）若有不足，請留言，在此先感謝！

『叄』 Python 怎麼解析 xml字元串

1. 我上面這段xml代碼，一開始沒有注意看，在每一個元素的結尾元素中都含有轉義符，這就是為什麼我用xml解析插件時一直保報錯的原因，因為他不是正規的xml格式。我的方法是用正則替換掉：re.sub(r'(<)\\(/.+?>)',r'\g<1>\g<2>',f_xml) 對於Python中的正則re的sub用法
2. 處理成正規的xml格式後，我這里還是用ElementTree來解析的，但在載入時又報錯：
cElementTree.ParseError: XML or text declaration not at start of entity: line 2, column 0
這個錯誤我在網上沒有找到合適的答案，不過根據字面意思來解決，就是在開頭的地方有錯誤。這里我嘗試這吧xml的文檔聲明給去掉了，居然沒有報錯。這里有些不理解為什麼不能加？我的方法：f_xml=test_xml.replace('<?xml version="1.0" encoding="gbk"?>','')
3. 然後再載入，就能獲取到相應的節點了。

『肆』 Python get返回xml解析問題

你這貼的代碼格式都不調一下，看的好痛苦。。。。。

另：貼一份我早期寫的一個解析xml轉換為字典的代碼，支持中文

細微部分，你自己調

importxml.etree.ElementTreeasET
importos
'''
將指定目錄下的xml文件轉換為字典dict
strXmlFileName：xml文件name
strElementPath：xml節點
dictSubElement：dict用於返回
eg.my_dict=xml2dict('xxx.xml','node',my_dict)
'''
defxml2dict(strXmlFileName,strElementPath,dictSubElement):
elementList=[]
dictSubElement.clear()
try:
eTree=ET.parse(os.getcwd()+strXmlFileName)
exceptException,errorinfo:
print"xml2dict:ET.parse(%s)generateexception,errorinfo:%s"%((os.getcwd()+strXmlFileName),errorinfo)
raiseerrorinfo

try:
elementList=eTree.findall(strElementPath)
exceptException,errorinfo:
print"xml2dict:eTree.findall(%s)generateexception,errorinfo:%s"%(strElementPath,errorinfo)
raiseerrorinfo

pathList=[]
forelementinelementList:
forsubelementinelement.getchildren():
#print"tag:%s,text:%s"%(subelement.tag,subelement.text.encode("utf-8"))
ifsubelement.textisnotNone:
ifsubelement.taginpathList:
dictSubElement[subelement.tag]=(os.getcwd()+subelement.text).encode('utf-8')
else:
dictSubElement[subelement.tag]=subelement.text.encode('utf-8')
else:
dictSubElement[subelement.tag]=""#將None賦值一串空字元串

『伍』 python如何解析xml格式的字元串，最好解析成鍵值對的那種，

有現成的庫可以用，xml.etree.ElementTree，或者xml.dom.minidom，ET相對來說簡單一些，而minidom配上node緩存也是一種不錯的實現，原理都一樣，就是把xml先轉化為dom樹。這兩個庫可以參考官方文檔，xml以及dom樹可以參考w3school

『陸』 python怎麼向已經存在的xml文件中追加填入數據

直接操作文件肯定不現實，只能先使用python自帶模塊xml.etree 解析xml，然後找到對應的節點把數據添加進去，重新寫入文件。

『柒』 python讀取xml文件有哪些方法

1、以下幾種方法建議初學者使用：

xml.etree.ElementTree
xml.dom
xml.dom.minidom
xml.dom.pulldom
xml.parsers.expat
其中，第一個模塊更加輕便簡介，對於簡單的xml文檔，推薦使用

下面的方法涉及知識比較多，熟練掌握上面方法後可以了解使用：

2、Dom讀取

3、Dom4j讀取
使用dom4j需要導入相關的jar包

import java.io.File;
import java.util.Iterator;
import java.util.List;

4、JDom讀取
使用jdom需要導入相關的jar包

import java.io.FileInputStream;

import java.io.InputStream;

5、Sax讀取

6、properties的讀取

『捌』如何使用Python和xml.etree.ElementTree解析xml文件獲取其節點

<?xmlversion="1.0"encoding="utf-8"?>
<root>
	<bodyname="lyc">
		<age>110</age>
	</body>
	<bodyname="l"age="10">
	</body>
</root>

######################


#coding=UTF8

fromxml.etreeimportElementTree

#xmlText=open("xml.txt").read()
#root=ElementTree.fromstring(xmlText)

root=ElementTree.parse("xml.txt")
bodys=root.getiterator("body")

#getiterator方法獲取
print"getiterator"
printbodys
printdir(bodys[0])
print"attrib:",bodys[0].attrib
print"tag:",bodys[0].tag
print"text",bodys[0].text
#getchildren方法獲取
print"getchildren"
children=bodys[0].getchildren()
printchildren
print"attrib:",children[0].attrib
print"tag:",children[0].tag
print"text:",children[0].text
#find
print"find"
children=root.find("body")
printchildren
print"attrib:",children.attrib
print"tag:",children.tag
print"text:",children.text
#findall
print"findall"
children=root.findall("body")
printchildren
print"attrib:",children[0].attrib
print"tag:",children[0].tag
print"text:",children[0].text

『玖』 python 解析xml需要什麼模塊

Python的標准庫中，提供了6種可以用於處理XML的包。

（1）xml.dom

xml.dom實現的是W3C制定的DOM API。如果你習慣於使用DOM API或者有人要求這這樣做，可以使用這個包。不過要注意，在這個包中，還提供了幾個不同的模塊，各自的性能有所區別。

DOM解析器在任何處理開始之前，必須把基於XML文件生成的樹狀數據放在內存，所以DOM解析器的內存使用量完全根據輸入資料的大小。

（2）xml.dom.minidom

xml.dom.minidom是DOM API的極簡化實現，比完整版的DOM要簡單的多，而且這個包也小的多。那些不熟悉DOM的朋友，應該考慮使用xml.etree.ElementTree模塊。據lxml的作者評價，這個模塊使用起來並不方便，效率也不高，而且還容易出現問題。

pythonetree解析xml

與pythonetree解析xml相關的資訊