您的位置:首页 > 其它

2007年百度之星程序设计大赛试题初赛题目-题1-百度的高级搜索方法

2012-05-19 13:24 555 查看
题面描述:

你尝试过在百度上使用 site inurl 语法查询吗 ? 如果还没有的话可以试一下 :)

如输入 site:www.baidu.com inurl:news

则会搜出所有在 www.baidu.com 站点上的包含 "news" 子串的 url 。

现在我们有两份数据,一份是 site_inurl.txt 一份是 url.txt

site_inurl.txt 中每行是一个 site inurl 语法组成的查询串, url.txt 中保存的是 url 列表。

你能否在 url 列表中找出所有能被 site_inurl.txt 中的查询串检索到的 url?

如 site_inurl.txt 内容如下:

site:www.baidu.com inurl:/more

site:zhidao.baidu.com inurl:/browse/

site:www.sina.com.cn inurl:www20041223am

url.txt 内容如下:
http://www.baidu.com/more/
http://www.baidu.com/guding/more.html
http://www.baidu.com/events/20060105/photomore.html
http://hi.baidu.com/browse/
http://hi.baidu.com/baidu/
http://www.sina.com.cn/head/www20021123am.shtml
http://www.sina.com.cn/head/www20041223am.shtml

则你的程序运行完输出的结果应该为:
http://www.baidu.com/more/
http://www.baidu.com/guding/more.html
http://www.sina.com.cn/head/www20041223am.shtml

程序以命令行形式传入这两个文件名,第一个参数为 site_inurl 文件对应的文件名,第二个参数为 url 列表对应的文件名,程序的输出请输出到标准输出。

my answer:

把每个串分去掉不需要的信息,提取出两部分,一个是站点名node.site,一个是字符串node.name

然后用KMP算法进行匹配,KMP算法模版:中的Find()

没有对特殊情况处理,假设所有输入都正确

#include <iostream>
#include <fstream>
#include <string>
using namespace std;

struct node
{
	string str;
	string site;
	string name;
}url[500];

string url_txt;
string site_inurl1, site_inurl2;
int next[100];
void insert(string url_txt, int x);
node trans(string a, string b);
bool match(node a, node b);
void selfcmp(string str);
int KMP(string a, string b);

int main()
{
	int cnt = 0;
	ifstream fin1, fin2;
	fin1.open("url.txt");
	while(fin1>>url_txt)
		insert(url_txt, cnt++);
	fin1.close();
	fin2.open("site_inurl.txt");
	while(fin2>>site_inurl1>>site_inurl2)
	{
		node target = trans(site_inurl1, site_inurl2);
		selfcmp(target.name);
		for(int i = 0; i < cnt; i++)
		{
			if(match(url[i], target))
				cout<<url[i].str<<endl;
		}
	}
	fin2.close();
	return 0;
}

void insert(string url_txt, int x)
{
	url[x].str = url_txt;
	url[x].site = "";
	url[x].name = "";
	int j = 7;
	while(url_txt[j] != '/')
		url[x].site += url_txt[j++];
	while(url_txt[j] != '\0')
		url[x].name += url_txt[j++];
}

node trans(string a, string b)
{
	node ret;
	ret.site == "";
	int j = 5;
	while(a[j] != '\0')
		ret.site += a[j++];
	j = 6;
	while(b[j] != '\0')
		ret.name += b[j++];
	return ret;
}

bool match(node a, node b)
{
	if(a.site != b.site)
		return 0;
	if(KMP(a.name, b.name)>=0)
		return 1;
	return 0;
}

int KMP(string a, string b)
{  
	int la = a.length();  
	int lb = b.length();  
  
    int i,j;  
    for(i=j=0; i<la&&j<lb; i++)  
    {  
        if(a[i] == b[j])  
            j++;  
        else if(j)  
        {  
            j = next[j-1]+1;  
            i--;  
        }  
    }  
    return j==lb?(i-lb):-1;  
}  
  
void selfcmp(string str)
{  
	int len = str.length();
    memset(next, 0 , sizeof(next));  
    int i = 0, j;  
    next[0] = -1;  
    for(j = 1; j < len; j++)  
    {  
        for(i = next[j-1]; i>=0&&(str[i+1]!=str[j]); i = next[i])  
            ;  
        next[j] = (str[i+1]==str[j]) ? i+1 : -1;  
    }  
}
内容来自用户分享和网络整理,不保证内容的准确性,如有侵权内容,可联系管理员处理 点击这里给我发消息
标签: 
相关文章推荐