python网络编程学习笔记(六)：Web客户端访问

6.1 最简单的爬虫

网络爬虫是一个自动提取网页的程序，它为搜索引擎从万维网上下载网页，是搜索引擎的重要组成。python的urllib\urllib2等模块很容易实现这一功能，下面的例子实现的是对baidu首页的下载。具体代码如下：

6.2 提交表单数据

(2)用post方法提交

urllib.urlopen(url[, data[, proxies]]) :
本函数创建一个表示远程url的类文件对象，然后像本地文件一样操作这个类文件对象来获取远程数据。参数url表示远程数据的路径，一般是网址；参数data表示以post方式提交到url的数据；参数proxies用于设置代理。urlopen返回一个类文件对象，返回的类文件对象提供了如下方法：

urllib.urlretrieve(url[, filename[, reporthook[, data]]])：
urlretrieve方法直接将远程数据下载到本地。参数filename指定了保存到本地的路径（如果未指定该参数，urllib会生成一个临时文件来保存数据）；参数reporthook是一个回调函数，当连接上服务器、以及相应的数据块传输完毕的时候会触发该回调（即每下载一块就调用一次回调函数）。我们可以利用这个回调函数来显示当前的下载进度，也可以用于限速，下面的例子会展示。参数data指post到服务器的数据。该方法返回一个包含两个元素的元组(filename, headers)，filename表示保存到本地的路径， header表示服务器的响应头。

代码如下:

#! /usr/bin/env python 
# coding: utf-8 
"""下载文件，并显示下载进度"""
import urllib

def DownCall(count,size,total_filesize):
    """count为已下载数据块个数，size为数据块的大小，total_filesize为文件总大小"""
    per=100.0*count*size/total_filesize
    if per>100:
        per=100
    print "Already download %d KB(%.2f" %(count*size/1024,per)+"%)"