C#使用NSoup解析HTML的乱码解决

C#使用NSoup解析HTML的乱码解决
NSoup是JSoup的Net移植版本。使用方法基本一致。

如果项目涉及HTML的处理，强烈推荐NSoup，毕竟字符串截断太苦逼了。

下载地址：

http://nsoup.codeplex.com/

简单用法如下：
```
NSoup.Nodes.Document doc = NSoup.NSoupClient.Parse(HtmlString);
```
处理网络上的页面：
```
NSoup.Nodes.Document doc = NSoup.NSoupClient.Connect("http://www.cnblogs.com/htynkn/").Get();
```
但是遗憾的是NSoup默认的编码是UTF-8，处理中文有乱码（对于编码是UTF-8的自然不会有乱码，但是有些GB2312的就可能有乱码，谢谢 forhells的提醒）。

目前我找到两种解决办法：

1.下载网页源代码再处理
```
WebClient webClient = new WebClient();
String HtmlString=Encoding.GetEncoding("utf-8").GetString(webClient.DownloadData("http://www.cnblogs.com/htynkn/"));
NSoup.Nodes.Document doc = NSoup.NSoupClient.Parse(HtmlString);
```
2.获得网页的流
```
WebRequest webRequest=WebRequest.Create("http://www.cnblogs.com/htynkn/");
NSoup.Nodes.Document doc = NSoup.NSoupClient.Parse(webRequest.GetResponse().GetResponseStream(),"utf-8");
```
第二种用着比较方便，但是我觉得第一种比较合适，毕竟NSoup是个Html解析类，下载网页代码这种事情本来不应该交给它。
作者：黄云坤
出处：http://www.huangyunkun.com/
本文版权归作者所有，欢迎转载，但未经作者同意必须保留此段声明，且在文章页面明显位置给出原文连接，否则保留追究法律责任的权利。
支持：新浪微博
相关阅读:
Java线程
 IO流
 staitc
权限修饰符
 nexus
Maven
Git 常用命令
 获取url参数
 创建存储过程和函数
 三层引号
原文地址：https://www.cnblogs.com/htynkn/p/NSoup_luanma.html