关于java：如何从XML字符串中加载org.w3c.dom.Document？

How do I load an org.w3c.dom.Document from XML in a string?

我在字符串中有一个完整的XML文档，想要一个Document对象。 Google会产生各种垃圾。什么是最简单的解决方案？ (在Java 1.5中)

解决方案感谢Matt McMinn，我决定完成此实现。对我来说，它具有适当级别的输入灵活性和异常粒度。 (很高兴知道错误是来自格式错误的XML-SAXException-还是来自错误的IO-IOException。)

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20

public static org.w3c.dom.Document loadXMLFrom(String xml)
throws org.xml.sax.SAXException, java.io.IOException {
return loadXMLFrom(new java.io.ByteArrayInputStream(xml.getBytes()));
}

public static org.w3c.dom.Document loadXMLFrom(java.io.InputStream is)
throws org.xml.sax.SAXException, java.io.IOException {
javax.xml.parsers.DocumentBuilderFactory factory =
javax.xml.parsers.DocumentBuilderFactory.newInstance();
factory.setNamespaceAware(true);
javax.xml.parsers.DocumentBuilder builder = null;
try {
builder = factory.newDocumentBuilder();
}
catch (javax.xml.parsers.ParserConfigurationException ex) {
}
org.w3c.dom.Document doc = builder.parse(is);
is.close();
return doc;
}

哇！

此代码可能存在严重的问题，因为它会忽略String中指定的字符编码(默认为UTF-8)。调用String.getBytes()时，平台默认编码用于将Unicode字符编码为字节。因此，解析器可能认为它实际上正在获取UTF-8数据，而实际上它正在获取EBCDIC或不漂亮的东西！

相反，使用带InputSource的parse方法，可以使用Reader构造它，如下所示：

1
2
3
4

import java.io.StringReader;
import org.xml.sax.InputSource;
…
return builder.parse(new InputSource(new StringReader(xml)));

看起来似乎没什么大不了，但是对字符编码问题的无知导致了类似于y2k的隐匿代码腐烂。

在Java 1.5中这对我有效-我去除了特定的可读性例外。

1
2
3
4
5
6
7
8
9
10
11
12
13
14

import javax.xml.parsers.DocumentBuilderFactory;
import javax.xml.parsers.DocumentBuilder;
import org.w3c.dom.Document;
import java.io.ByteArrayInputStream;

public Document loadXMLFromString(String xml) throws Exception
{
DocumentBuilderFactory factory = DocumentBuilderFactory.newInstance();

factory.setNamespaceAware(true);
DocumentBuilder builder = factory.newDocumentBuilder();

return builder.parse(new ByteArrayInputStream(xml.getBytes()));
}

只是有一个类似的问题，除了我需要一个NodeList而不是一个Document，这就是我的想法。它与以前的解决方案基本相同，但经过增强后可以将根元素作为NodeList删除，并使用erickson的建议使用InputSource代替字符编码问题。

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15

private String DOC_ROOT="root";
String xml=getXmlString();
Document xmlDoc=loadXMLFrom(xml);
Element template=xmlDoc.getDocumentElement();
NodeList nodes=xmlDoc.getElementsByTagName(DOC_ROOT);

public static Document loadXMLFrom(String xml) throws Exception {
InputSource is= new InputSource(new StringReader(xml));
DocumentBuilderFactory factory = DocumentBuilderFactory.newInstance();
factory.setNamespaceAware(true);
DocumentBuilder builder = null;
builder = factory.newDocumentBuilder();
Document doc = builder.parse(is);
return doc;
}

为了用Java处理XML，我总是倾向于使用Transformer API：

1
2
3
4
5
6
7
8
9
10
11
12

import javax.xml.transform.Source;
import javax.xml.transform.TransformerException;
import javax.xml.transform.TransformerFactory;
import javax.xml.transform.dom.DOMResult;
import javax.xml.transform.stream.StreamSource;

public static Document loadXMLFrom(String xml) throws TransformerException {
Source source = new StreamSource(new StringReader(xml));
DOMResult result = new DOMResult();
TransformerFactory.newInstance().newTransformer().transform(source , result);
return (Document) result.getNode();
}

关于java：如何从XML字符串中加载org.w3c.dom.Document？

How do I load an org.w3c.dom.Document from XML in a string?

推荐阅读

linux命令刷新加载？

linux进入文档命令？

加载linux内核的命令？

linux命令查找字符串？

linux加载没有的命令？

linux上传文档命令？

linux如何命令建文档？

linux命令打开文档？

linux剪切文档命令是？

linux简单的文档命令？

linux查询文档命令？

加载变量的linux命令？

linux模块化加载命令？

linux命令加载模块？

linux文档常用命令？

linux命令文档离线版？

linux命令字符串匹配？

linux命令加载驱动？

linux文档注释命令？

python字符串截取？