关于解析网页的问题

AdenPlus 2005-07-25 04:21:58

我想问一下各位大大，到底是用IE的COM接口解析好，还是自己通过http拿到网页源码用正则表达式解析好，两者各有何利弊？

...全文

457 11 打赏收藏转发到动态举报

写回复

用AI写文章

11 条回复

切换为时间正序

请发表友善的回复…

发表回复

Alan S1 2005-08-02

打赏
举报

horisly 2005-07-28

打赏
举报

mark.

AdenPlus 2005-07-28

打赏
举报

有一种情况，如果网页已经打开浏览器里打开，我还要再建立一个Http连接取Html文件，是不是有点傻，有没有比较智能的方法，就是如果一个网页在浏览器里被打开，我就从IE的Com接口里取，如果没打开，我就自己建立Http链接取回Html文件再用正则表达式搜索？

还有用正则表达式搜索里面的字符串对于Javascript、VBScript和JScript里的链接是不是一样可以拿的到呢？这里面的链接不一定是Href开头的啊？

AntonlioX 2005-07-27

打赏
举报

《如何提取网页中所有链接》
http://www.vckbase.com/document/viewdoc/?id=646

＝＝＝＝＝＝＝＝＝＝＝＝＝＝＝＝＝＝＝＝＝＝＝＝＝＝＝
见过“网际快车”的“使用网际快车下载全部链接”这个功能吗？想实现它，我们可以这样做：
IE有几个有用的接口，我们可以用它来提取网页所有链接。

一、基本原理

首先是用IHTMLDocument2的get_links，来获取IHTMLElementCollection接口，再通过IHTMLElementCollection来获取IHTMLAnchorElement，而IHTMLAnchorElement接口的get_href就是我们想要的，通过循环获取，我们就可以得到网页的所有链接了！

二、具体代码

{
TCHAR HostName[2*MAX_PATH];
CComPtr<IDispatch> spDispatch;
CComQIPtr<IHTMLDocument2, &IID_IHTMLDocument2> pDoc2;
CComPtr<IHTMLElementCollection> pElementCol;
CComPtr<IHTMLAnchorElement> pLoct;
// TODO: Add your control notification handler code here
int n = m_LinksList.GetItemCount();//GetCount();

for (int i = 0; i < n; i ++){
IWebBrowser2 *pBrowser = (IWebBrowser2 *)m_LinksList.GetItemData(i);
if (pBrowser){
pBrowser->Release();
}
}

m_LinksList.DeleteAllItems();
m_LinksNum = 0;
Log("**************************************************************");
Log("\r\n");

if (m_spSHWinds){
int n = m_spSHWinds->GetCount();
for (int i = 0; i < n; i++){
_variant_t v = (long)i;
IDispatchPtr spDisp = m_spSHWinds->Item(v);

SHDocVw::IWebBrowser2Ptr spBrowser(spDisp); //生成一个IE窗口的智能指针
if (spBrowser){

if (SUCCEEDED(spBrowser->get_Document( &spDispatch)))
pDoc2 = spDispatch;
if(pDoc2!=NULL)
{
if (SUCCEEDED(pDoc2->get_links(&pElementCol)))
{
// AfxMessageBox("IHTMLElementCollection");
long p=0;
if(SUCCEEDED(pElementCol->get_length(&p)))
if(p!=0)
{
m_LinksNum = m_LinksNum+p;
UpdateData(FALSE);

for(long i=0;i<=(p-1);i++)
{

BSTR String;
_variant_t index = i;
if(SUCCEEDED(pElementCol->item( index, index, &spDispatch)))
if(SUCCEEDED(spDispatch->QueryInterface( IID_IHTMLAnchorElement,(void **) &pLoct)))

pLoct->get_href(&String);
ZeroMemory(HostName,2*MAX_PATH);
lstrcpy(HostName,_bstr_t(String));
m_LinksList.InsertItem(i,HostName);
m_LinksList.SetCheck(i,TRUE);

pLoct->get_hostname(&String);
ZeroMemory(HostName,2*MAX_PATH);
lstrcpy(HostName,_bstr_t(String));
if(lstrlen(HostName))
{
m_LinksList.SetItemText(i,1,HostName);
Log(HostName );
Log("\r\n");
}

}
}
}

}

}
}
}
}
本程序在VC7+WINXP下编译通过，详细请看源代码！

AntonlioX 2005-07-27