python urlopen.read()不完整

发布于 2022-09-03 01:26:29 字数 1256 浏览 20 评论 0

这个目的说来有点不忍启齿....不过抱着解决问题的态度,我还是提了这个问题:
这个是原网页
https://movie.douban.com/tag/%E6%83%85%E8%89%B2?start=0&type=T

这个网页有20个电影,但我抓取的结果只有17个,我调试发现的问题是出在刚开始urlopen.read()就没读全整个网页,不知道是不是因为标签使用不合法导致的没读到。
这是测试的代码:

import sys
import time
import urllib2
import random
import requests
from bs4 import BeautifulSoup

page_num=0
movie_list=[]
try_times = 0
url="https://movie.douban.com/tag/%E6%83%85%E8%89%B2?start="+str(page_num*20)+"&type=T"
time.sleep(random.uniform(1, 2))
try:
    source_code = urllib2.urlopen(url).read()
    plain_text=str(source_code)
    print plain_text
except (urllib2.HTTPError, urllib2.URLError), e:
    print e
soup = BeautifulSoup(plain_text)
list_soup=soup.find('div',{'class':['']})

请问该如何解决?并且这个问题的原因到底是什么?
请你们注意,
https://movie.douban.com/tag/%E6%83%85%E8%89%B2?start=0&type=T
这个URL里start也从0开始,第二页是20,第三页是40,以20递增,我自己也数过,每页是有20本电影,但是读取的时候只有17.
图片描述

如果你对这篇内容有疑问,欢迎到本站社区发帖提问 参与讨论,获取更多帮助,或者扫码二维码加入 Web 技术交流群。

扫码二维码加入Web技术交流群

发布评论

需要 登录 才能够评论, 你可以免费 注册 一个本站的账号。

评论(3

黯淡〆 2022-09-10 01:26:29

这个网页就17个电影。
补充:
未登录状态下,结果是17条。
登录状态下,结果是20条。
根据此逻辑,可以通过模拟登录,解决这个问题。

涫野音 2022-09-10 01:26:29

clipboard.png

用chrome的拷贝xpath功能,拷贝最后一个电影的xpath,是第17个.
//*[@id="content"]/div/div[1]/div[2]/table[17]

~没有更多了~
我们使用 Cookies 和其他技术来定制您的体验包括您的登录状态等。通过阅读我们的 隐私政策 了解更多相关信息。 单击 接受 或继续使用网站,即表示您同意使用 Cookies 和您的相关数据。
原文