国内网页搜索与内容提取
概述
本技能通过国内可访问的搜索引擎和网页抓取方式获取网络信息。 不使用 Google、Tavily、Exa 等需要翻墙或国外 API Key 的服务。
可用搜索源
| 搜索源 | 用途 | 调用方式 |
| :--- | :--- | :--- |
| 必应中国 | 通用搜索 | https://cn.bing.com/search?q=<关键词> |
| 百度 | 中文搜索 | https://www.baidu.com/s?wd=<关键词> |
| 搜狗 | 中文搜索 | https://www.sogou.com/web?query=<关键词> |
| 微博热搜 | 实时热点 | https://s.weibo.com/top/summary |
| 知乎 | 问答类内容 | https://www.zhihu.com/search?q=<关键词> |
执行方式
方式一:直接用 curl 抓取搜索结果页
curl -s "https://cn.bing.com/search?q=今日中国新闻" \
-H "User-Agent: Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36" \
-H "Accept-Language: zh-CN,zh;q=0.9" \
| python -c "import sys,re; html=sys.stdin.read(); print(re.sub(r'<[^>]+>','',html)[:3000])"
微信扫一扫