有办法遍历出所有淘宝号吗?

Peter_Parker 2013-01-14 12:38:00
http://www.taodake.com/HistoryList_all_4.html

这个连接里的,500000条记录,但是分页了!如果能一次性搞出来就好了!
...全文
620 23 打赏 收藏 转发到动态 举报
写回复
用AI写文章
23 条回复
切换为时间正序
请发表友善的回复…
发表回复
浪漫小和 2013-01-21
  • 打赏
  • 举报
回复
哈哈,不错.学习学习..jsoup.
Peter_Parker 2013-01-21
  • 打赏
  • 举报
回复
引用 20 楼 gagewang1 的回复:
引用 19 楼 qinceo 的回复:引用 17 楼 gagewang1 的回复:引用 16 楼 qinceo 的回复: 引用 15 楼 gagewang1 的回复:引用 13 楼 qinceo 的回复: 引用 9 楼 gagewang1 的回复:用jsoup很方便,下个jsoup.jar就可以用了。可能需要在优化下 1234567891011121314…… ……
为什么会出现异常呢,如果调整等待时间,或者不用线程会不会好一点!
huangzebiao007 2013-01-20
  • 打赏
  • 举报
回复
学习了,字数不够,再写写
中华雪碧 2013-01-19
  • 打赏
  • 举报
回复
引用 19 楼 qinceo 的回复:
引用 17 楼 gagewang1 的回复:引用 16 楼 qinceo 的回复: 引用 15 楼 gagewang1 的回复:引用 13 楼 qinceo 的回复: 引用 9 楼 gagewang1 的回复:用jsoup很方便,下个jsoup.jar就可以用了。可能需要在优化下 1234567891011121314……
写个异常的log
中华雪碧 2013-01-18
  • 打赏
  • 举报
回复
引用 13 楼 qinceo 的回复:
引用 9 楼 gagewang1 的回复:用jsoup很方便,下个jsoup.jar就可以用了。可能需要在优化下 Java code ? 1234567891011121314151617181920212223242526 package com.joup; import java.io.IOException; import o……

package com.joup;

import org.jsoup.nodes.Document;
import org.jsoup.nodes.Element;
import org.jsoup.select.Elements;

public class TaoThread extends Thread{
	private Document doc;

	public TaoThread() {
	}
	public TaoThread(Document doc) {
		this.doc = doc;
	}
	@Override
	public void run() {
		Elements ids = doc.getElementsByClass("id_td");
		Elements names = doc.getElementsByClass("zh_td");
		for(int i=0;i<ids.size();i++){
			System.out.println("id:"+ids.get(i).text()+" zh:"+names.get(i).text());
		}
	}
}
可以研究下jsoup,很方便
Peter_Parker 2013-01-18
  • 打赏
  • 举报
回复
引用 17 楼 gagewang1 的回复:
引用 16 楼 qinceo 的回复: 引用 15 楼 gagewang1 的回复:引用 13 楼 qinceo 的回复: 引用 9 楼 gagewang1 的回复:用jsoup很方便,下个jsoup.jar就可以用了。可能需要在优化下 Java code ? 1234567891011121314151617181920212223242526 package……
第3900页异常 java.net.SocketTimeoutException: connect timed out; 打开网页有点慢就挂了!
IsShare 2013-01-18
  • 打赏
  • 举报
回复
太神奇了,留名以后学习
kyolxs 2013-01-18
  • 打赏
  • 举报
回复
中华雪碧 2013-01-18
  • 打赏
  • 举报
回复
引用 16 楼 qinceo 的回复:
引用 15 楼 gagewang1 的回复:引用 13 楼 qinceo 的回复: 引用 9 楼 gagewang1 的回复:用jsoup很方便,下个jsoup.jar就可以用了。可能需要在优化下 Java code ? 1234567891011121314151617181920212223242526 package com.jou……
不会
Peter_Parker 2013-01-18
  • 打赏
  • 举报
回复
引用 15 楼 gagewang1 的回复:
引用 13 楼 qinceo 的回复: 引用 9 楼 gagewang1 的回复:用jsoup很方便,下个jsoup.jar就可以用了。可能需要在优化下 Java code ? 1234567891011121314151617181920212223242526 package com.joup; import java.io.IOException; ……
这样字不会错位吗?
Peter_Parker 2013-01-17
  • 打赏
  • 举报
回复
为什么会这样::::java.net.UnknownHostException: www.taodake.com
Peter_Parker 2013-01-17
  • 打赏
  • 举报
回复
引用 9 楼 gagewang1 的回复:
用jsoup很方便,下个jsoup.jar就可以用了。可能需要在优化下 Java code ? 1234567891011121314151617181920212223242526 package com.joup; import java.io.IOException; import org.jsoup.Jsoup; import org.jsoup.n……
id是取出来了,但是我想要中文ID,怎么一对一绑定现实出来呢?
michaelhubu 2013-01-15
  • 打赏
  • 举报
回复
top top and Jsoup
zxj828282 2013-01-15
  • 打赏
  • 举报
回复
top top top
Tnz_ME 2013-01-15
  • 打赏
  • 举报
回复
引用 7 楼 zxj828282 的回复:
top top top
+1
Peter_Parker 2013-01-15
  • 打赏
  • 举报
回复
哪里下载jar包啊!
中华雪碧 2013-01-15
  • 打赏
  • 举报
回复
用jsoup很方便,下个jsoup.jar就可以用了。可能需要在优化下

package com.joup;

import java.io.IOException;

import org.jsoup.Jsoup;
import org.jsoup.nodes.Document;

public class Taodake {
	private static String url="http://www.taodake.com/HistoryList_all_";
	private static int start_page = 1;
	private static int last_page = 10;
	public static void main(String[] args){
		Document doc = null;;
		for(int i=start_page;i<last_page;i++){
			try {
				doc = Jsoup.connect(url+i+".html").get();
			} catch (IOException e) {
				System.out.println("第"+i+"页异常");
				e.printStackTrace();
			}
			TaoThread tao = new TaoThread(doc);
			tao.start();
		}
	}
}


package com.joup;

import org.jsoup.nodes.Document;
import org.jsoup.nodes.Element;
import org.jsoup.select.Elements;

public class TaoThread extends Thread{
	private Document doc;

	public TaoThread() {
	}
	public TaoThread(Document doc) {
		this.doc = doc;
	}
	@Override
	public void run() {
		Elements ids = doc.getElementsByClass("id_td");
		for(Element id:ids){
			System.out.println("取出id:"+id.text());
		}
	}
}

wapigzhu 2013-01-14
  • 打赏
  • 举报
回复
他的页数是拼在最后面的,自己挨着拼就行了..多线程去读嘛
流星陨落 2013-01-14
  • 打赏
  • 举报
回复
_jerrytiger 2013-01-14
  • 打赏
  • 举报
回复
无法访问啊。
加载更多回复(3)

62,621

社区成员

发帖
与我相关
我的任务
社区描述
Java 2 Standard Edition
社区管理员
  • Java SE
加入社区
  • 近7日
  • 近30日
  • 至今
社区公告
暂无公告

试试用AI创作助手写篇文章吧