爬取几个网站内的文字和图片信息,目标网站完全没有反爬机制,重点就是要快,越快越好。要图片信息和少量文字信息。举例来说 opentopia.com skylinewebcams.com 内的视频图像和视频的 url 和文字信息。详讯麻花腾:腰腰霸腰霸叁叁玲叁伍 null。真的超级紧急,工作量真的很少。
11 条回复 • 2018-01-23 14:50:08 +08:00
|
1
ofnh 2018 年 1 月 17 日 via Android 哈哈,我想起了产品经理说工作量很少
|
|
2
yech1990 2018 年 1 月 17 日 via Android
应该不难啊, 具体哪个网站?
--- 如果你想爬点训练集,这个是跑不掉的,不如花点时间钻研。 其他用途就另一回事了。 |
|
3
wyan453351466 2018 年 1 月 17 日 via iPhone
|
|
4
inksong OP @yech1990 不超过 10 个网站,不要求量。我本身自己能写,原来爬过 insecam 的爬了 3w 多条,现在是实在紧急,工作量上我真不觉得大。
|
|
6
ryV60s 2018 年 1 月 17 日
@wyan453351466 使劲点菜单,然后所有操作都 404 ?
|
|
7
carsonlee32 2018 年 1 月 17 日
产品 [我需要这个页面加载速度快很多] 开发 [多快?] 产品 [快很多]
|
|
8
lieh222 2018 年 1 月 17 日
@wyan453351466 你站上的知乎日报是不是挂了
|
|
9
wyan453351466 2018 年 1 月 17 日 via iPhone
@lieh222 没有啊
|
|
10
xiaoheijw 2018 年 1 月 20 日
工作量小是多小?
|
|
11
inksong OP 已经搞定了,感谢几位出力的大佬。
|
推荐学习书目
› Learn Python the Hard Way
Python Sites
› PyPI - Python Package Index
› http://diveintopython.org/toc/index.html
› Pocoo
值得关注的项目
› PyPy
› Celery
› Jinja2
› Read the Docs
› gevent
› pyenv
› virtualenv
› Stackless Python
› Beautiful Soup
› 结巴中文分词
› Green Unicorn
› Sentry
› Shovel
› Pyflakes
› pytest
Python 编程
› pep8 Checker
Styles
› PEP 8
› Google Python Style Guide
› Code Style from The Hitchhiker's Guide