新浪网站验证码获取问题

amwdgv 2009-09-18 10:50:25

地址 http://nongye.sina.com.cn/z/ncp60/index.shtml

验证码地址 http://survey.finance.sina.com.cn/auth_number.php?survey=16ada1253242145ad371405a7976

新开一个窗口得不到验证码空白页

...全文

148 8 打赏收藏转发到动态举报

写回复

8 条回复

切换为时间正序

请发表友善的回复…

发表回复

amwdgv 2009-09-18

打赏
举报

回复

[Quote=引用 7 楼 amwdgv 的回复:]
引用 6 楼 wintergoes 的回复:
模拟点那个链接

模拟 ??
[/Quote]

var
doc:IHTMLDocument2;
elem : IHTMLElement;

doc := ihtmldocument2(WebBrowser1.Document);
elem := doc.all.item('标签ID',i);
elem.click

???

amwdgv 2009-09-18

打赏
举报

回复

[Quote=引用 6 楼 wintergoes 的回复:]
模拟点那个链接
[/Quote]

模拟 ??

wintergoes 2009-09-18

打赏
举报

回复

模拟点那个链接

amwdgv 2009-09-18

打赏
举报

回复

如何取下一张 get方法取不到数据

wintergoes 2009-09-18

打赏
举报

回复

buffsize:=65535;
改成
buffsize:=0;就行

wintergoes 2009-09-18

打赏
举报

回复

打开后,点看不清图片,换了另一张图片,地址类似
http://survey.finance.sina.com.cn/auth_number.php?survey=73c56125324508594371405412a4&t=1253245150734
然后用下面的代码从缓存主获取图片



uses wininet;



procedure TForm1.FormCreate(Sender: TObject);

var

  localFile: string;

  cacheInfo: PInternetCacheEntryInfoA;

  bufsize: Cardinal;

begin

  bufsize := 65535;

  cacheInfo := nil;

  GetUrlCacheEntryInfo('http://survey.finance.sina.com.cn/auth_number.php?survey=73c56125324495894371405412a4&t=1253245019265', cacheinfo^, bufsize);

  GetMem(cacheInfo, bufsize);

  if (GetUrlCacheEntryInfo(PChar('http://survey.finance.sina.com.cn/auth_number.php?survey=73c56125324495894371405412a4&t=1253245019265'), cacheInfo^, bufsize)) then

      showmessage(cacheinfo^.lpszLocalFileName)

  else

  begin

    ShowMessage('没有缓存.');

  end;

end;

amwdgv 2009-09-18

打赏
举报

回复

显示空白，没内容

wintergoes 2009-09-18

打赏
举报

回复

http://survey.finance.sina.com.cn/auth_number.php?survey=73c56125324229294371405412a4
用这好像没有问题

本资源是来自实践项目，是项目中的验证码识别学习程序。稍微加一些参数即可实现正常识别模式。压缩包中附带源代码 + 验证码 + 在线获取的验证码 （附带一个Google的灰度处理算法）包含算法：灰度处理算法、二差值算法、特提取算法、学习模式算法、以及验证码识别的整体思路和完整的实现方法。包括机器学习和机器自识别。本源代码使用GPL授权协议。（不适合已经有经验的图形图像处理人员，适合新手。）

爬虫（Web Crawler）是一种自动化程序，用于从互联网上收集信息。其主要功能是访问网页、提取数据并存储，以便后续分析或展示。爬虫通常由搜索引擎、数据挖掘工具、监测系统等应用于网络数据抓取的场景。爬虫的工作流程包括以下几个关键步骤： URL收集：爬虫从一个或多个初始URL开始，递归或迭代地发现新的URL，构建一个URL队列。这些URL可以通过链接分析、站点地图、搜索引擎等方式获取。请求网页：爬虫使用HTTP或其他协议向目标URL发起请求，获取网页的HTML内容。这通常通过HTTP请求库实现，如Python中的Requests库。解析内容：爬虫对获取的HTML进行解析，提取有用的信息。常用的解析工具有正则表达式、XPath、Beautiful Soup等。这些工具帮助爬虫定位和提取目标数据，如文本、图片、链接等。数据存储：爬虫将提取的数据存储到数据库、文件或其他存储介质中，以备后续分析或展示。常用的存储形式包括关系型数据库、NoSQL数据库、JSON文件等。遵守规则：为避免对网站造成过大负担或触发反爬虫机制，爬虫需要遵守网站的robots.txt协议，限制访问频率和深度，并模拟人类访问行为，如设置User-Agent。反爬虫应对：由于爬虫的存在，一些网站采取了反爬虫措施，如验证码、IP封锁等。爬虫工程师需要设计相应的策略来应对这些挑战。爬虫在各个领域都有广泛的应用，包括搜索引擎索引、数据挖掘、价格监测、新闻聚合等。然而，使用爬虫需要遵守法律和伦理规范，尊重网站的使用政策，并确保对被访问网站的服务器负责。

爬虫（Web Crawler）是一种自动化程序，用于从互联网上收集信息。其主要功能是访问网页、提取数据并存储，以便后续分析或展示。爬虫通常由搜索引擎、数据挖掘工具、监测系统等应用于网络数据抓取的场景。爬虫的工作流程包括以下几个关键步骤： URL收集：爬虫从一个或多个初始URL开始，递归或迭代地发现新的URL，构建一个URL队列。这些URL可以通过链接分析、站点地图、搜索引擎等方式获取。请求网页：爬虫使用HTTP或其他协议向目标URL发起请求，获取网页的HTML内容。这通常通过HTTP请求库实现，如Python中的Requests库。解析内容：爬虫对获取的HTML进行解析，提取有用的信息。常用的解析工具有正则表达式、XPath、Beautiful Soup等。这些工具帮助爬虫定位和提取目标数据，如文本、图片、链接等。数据存储：爬虫将提取的数据存储到数据库、文件或其他存储介质中，以备后续分析或展示。常用的存储形式包括关系型数据库、NoSQL数据库、JSON文件等。遵守规则：为避免对网站造成过大负担或触发反爬虫机制，爬虫需要遵守网站的robots.txt协议，限制访问频率和深度，并模拟人类访问行为，如设置User-Agent。反爬虫应对：由于爬虫的存在，一些网站采取了反爬虫措施，如验证码、IP封锁等。爬虫工程师需要设计相应的策略来应对这些挑战。爬虫在各个领域都有广泛的应用，包括搜索引擎索引、数据挖掘、价格监测、新闻聚合等。然而，使用爬虫需要遵守法律和伦理规范，尊重网站的使用政策，并确保对被访问网站的服务器负责。

在我们爬虫的时候经常会遇到验证码，新浪微博的验证码是四宫格形式。可以采用模板验证码的破解方式，也就是把所有验证码的情况全部列出来，然后拿验证码的图片和这所有情况中的图片进行对比，然后获取验证码，再通过selenium自动拖拽点击，进行破解。我们将验证码四个点标注为1234，那么所有的情况就是以下24种情况。数字代表箭头指向： 1234 2134 3124 4321 1243 2143 3142 4312 1342 2314 3214 4123 1324 2341 3241 4132 1423 2413 3412 4213 1432 2431 3421 4231

基于BERT构建新闻文本分类模型，并结合node.js + vue完成了一个可视化界面。爬虫（Web Crawler）是一种自动化程序，用于从互联网上收集信息。其主要功能是访问网页、提取数据并存储，以便后续分析或展示。爬虫通常由搜索引擎、数据挖掘工具、监测系统等应用于网络数据抓取的场景。爬虫的工作流程包括以下几个关键步骤： URL收集：爬虫从一个或多个初始URL开始，递归或迭代地发现新的URL，构建一个URL队列。这些URL可以通过链接分析、站点地图、搜索引擎等方式获取。请求网页：爬虫使用HTTP或其他协议向目标URL发起请求，获取网页的HTML内容。这通常通过HTTP请求库实现，如Python中的Requests库。解析内容：爬虫对获取的HTML进行解析，提取有用的信息。常用的解析工具有正则表达式、XPath、Beautiful Soup等。这些工具帮助爬虫定位和提取目标数据，如文本、图片、链接等。数据存储：爬虫将提取的数据存储到数据库、文件或其他存储介质中，以备后续分析或展示。常用的存储形式包括关系型数据库、NoSQL数据库、JSON文件等。遵守规则：为避免对网站造成过大负担或触发反爬虫机制，爬虫需要遵守网站的robots.txt协议，限制访问频率和深度，并模拟人类访问行为，如设置User-Agent。反爬虫应对：由于爬虫的存在，一些网站采取了反爬虫措施，如验证码、IP封锁等。爬虫工程师需要设计相应的策略来应对这些挑战。爬虫在各个领域都有广泛的应用，包括搜索引擎索引、数据挖掘、价格监测、新闻聚合等。然而，使用爬虫需要遵守法律和伦理规范，尊重网站的使用政策，并确保对被访问网站的服务器负责。

网络通信/分布式开发

1,593

社区成员

32,964

社区内容

发帖

与我相关

我的任务

社区管理员

加入社区

近7日
近30日
至今

加载中

查看更多榜单

社区公告

暂无公告

试试用AI创作助手写篇文章吧

+ 用AI写文章