Beautiful Soup 学术论文解析器
使用BeautifulSoup4与lxml解析器从学术知识库中提取结构化引用数据。解析来自PubMed、arXiv和Semantic Scholar HTML的DOI元数据、作者隶属关系和参考文献列表。
安装
使用与您的环境匹配的上游安装或设置路径:
- pip install beautifulsoup4
- format。在该目录中运行make html以创建HTML
上游的要求和注意事项:
- 需要:Python >=3.7.0
- Python
- Python :: 3
基本用法或入门说明:
-
from bs4 import BeautifulSoup
-
soup = BeautifulSoup("<p>Some<b>bad<i>HTML")
-
print(soup.prettify())
-
Source: https://pypi.org/project/beautifulsoup4/
Scan to join WeChat group