javascript - Python逐行读取txt中的url文件并进行爬虫

程序员文章站 2024-01-15 14:31:34

...

毕设项目需要爬取coursera的课程数据，已经把所有课程的url链接爬下来了，存在了txt中，一行是一个课程的url，现在想要获取每门课程的详细信息，如instructor，syllabus 和detail information这几项，但是都需要点进各个课程的网页链接中取爬取。码渣求大神指导一下，来段伪码就更好啦！thx

回复内容：

你好！不知道这是不是你想要的答案：

f = open("coursera.txt","r")
urlList = f.readlines()
for url in urlList:
    r = requests.get(url)
    ''''''

Good Luck ! ^_

如果是爬取coursera的课程数据，建议你用scrapy爬取，这样不需要提前抓取所有课程的url，只要写好匹配url就行。

scrapy教程 http://scrapy-chs.readthedocs.org/zh_CN/0.24/intro/tutorial.html
项目参考 https://github.com/Junnplus/OnlineJudgeCrawlerCore

上一篇： php时间戳格式化显示友好的时间函数分享

下一篇： omaws32.exe - omaws32是什么进程有什么用

javascript - Python逐行读取txt中的url文件并进行爬虫

回复内容：

javascript - Python逐行读取txt中的url文件并进行爬虫

Python实现读取txt文件中的数据并绘制出图形操作示例

javascript - Python逐行读取txt中的url文件并进行爬虫

使用python读取txt中的数字,并根据数字从别的文件夹选取图片保存在别的文件夹中

Python实现读取txt文件中的数据并绘制出图形操作示例