当前位置: 首页 > 工具软件 > GNE > 使用案例 >

Python通用新闻网站正文抽取器:GNE

潘飞英
2023-12-01

GeneralNewsExtractor(GNE)是一个通用新闻网站正文抽取模块,输入一篇新闻网页的 HTML, 输出正文内容、标题、作者、发布时间、正文中的图片地址和正文所在的标签源代码。GNE在提取今日头条、网易新闻、游民星空、 观察者网、凤凰网、腾讯新闻、ReadHub、新浪新闻等数百个中文新闻网站上效果非常出色,几乎能够达到100%的准确率。

安装

# 以下两种方案任选一种即可

# 使用 pip 安装
pip install --upgrade gne

# 使用 pipenv 安装
pipenv install gne

提取正文

from gne import GeneralNewsExtractor

extractor = GeneralNewsExtractor()
html = '网站源代码'
result = extractor.extract(html)
print(result)

参考

https://generalnewsextractor.readthedocs.io/zh_CN/latest/#api
https://github.com/GeneralNewsExtractor/GeneralNewsExtractor

 类似资料: