使用 HTTPClient 获取网页文本

发布于 2024-09-08 21:19:14 字数 409 浏览 8 评论 0原文

我刚刚开始使用 HTTPClient，我想获取一个网页并从中提取原始文本减去所有 html 标记。

HTTPClient 可以做到这一点吗？如果是这样，怎么办？或者我应该看看另一个图书馆吗？

例如，如果页面包含

<body><p>para1 test info</p><div><p>more stuff here</p></div>

我希望它输出

para1 test info more stuff here

原文

I'm just getting started with HTTPClient, and I want to take a webpage and extract out the raw text from it minus all the html markup.

Can HTTPClient accomplish that? If so, how? Or is there another library I should be looking at?

for example if the page contains

<body><p>para1 test info</p><div><p>more stuff here</p></div>

I'd like it to output

para1 test info more stuff here

分享到QQ

分享到微博

如果你对这篇内容有疑问，欢迎到本站社区发帖提问参与讨论，获取更多帮助，或者扫码二维码加入 Web 技术交流群。

发布评论

需要登录才能够评论，你可以免费注册一个本站的账号。

乄_柒ぐ汐 2024-09-15 21:19:15

不会。HttpClient 处理网络协议 - 发送请求和接收响应。收到回复后，您需要决定如何处理该回复。也就是说，您可以按照其他人的建议使用其他库来解析 HTML。

回复收藏 0 原文

苦行僧 2024-09-15 21:19:15

HTML 解析器库可能就是您正在寻找的。它允许从 HTML 文档中提取内容。

回复收藏 0 原文

美煞众生 2024-09-15 21:19:15

正如其他人提到的，您需要一个 HTML 解析库。这里是一个相关的问题。

回复收藏 0 原文

丧 2024-09-15 21:19:14

我建议使用 HttpComponents Client (HTTPClient 4) （而不是版本 3您已链接到）。

也就是说，它独立于 HTTP 客户端库（还有其他库）。您需要的是将 HTML 转换为纯文本。这可能很有趣： http://www.rgagnon.com/javadetails/java- 0424.html

回复收藏 0 原文

~没有更多了~

关于作者

征﹌骨岁月お

暂无简介

文章

27 人气

关注发私信

狼性发作

文章 0 评论 0

关注

美煞众生

文章 0 评论 0

关注

黑凤梨

文章 0 评论 0

关注

慕巷

文章 0 评论 0

关注

virou

文章 0 评论 0

关注

两仪

文章 0 评论 0

友情链接

文江博客

使用 HTTPClient 获取网页文本

如果你对这篇内容有疑问，欢迎到本站社区发帖提问参与讨论，获取更多帮助，或者扫码二维码加入 Web 技术交流群。

发布评论

评论（4）

关于作者

相关话题

热门标签

推荐作者

狼性发作

美煞众生

黑凤梨

慕巷

virou

两仪

友情链接

使用 HTTPClient 获取网页文本

如果你对这篇内容有疑问，欢迎到本站社区发帖提问 参与讨论，获取更多帮助，或者扫码二维码加入 Web 技术交流群。

发布评论

评论（4）

关于作者

相关话题

热门标签

推荐作者

狼性发作

美煞众生

黑凤梨

慕巷

virou

两仪

友情链接

如果你对这篇内容有疑问，欢迎到本站社区发帖提问参与讨论，获取更多帮助，或者扫码二维码加入 Web 技术交流群。