字符串的哈希查找

sk_soju 2008-01-13 04:10:55

采用比较经典的哈希字符串函数像RS Hash Function
unsigned int RSHash( char * str)
{
unsigned int b = 378551 ;
unsigned int a = 63689 ;
unsigned int hash = 0 ;

while ( * str)
{
hash = hash * a + ( * str ++ );
a *= b;
}

return (hash & 0x7FFFFFFF );
}
对于一个字符串ch来说 RSHash(ch)可以给出字符串的哈希值
那么如果需要读取一篇文章每个字符串的哈希值如何储存
另外储存后通过怎样的方式进行查找
请通过代码说明

...全文

1861 11 打赏收藏转发到动态举报

写回复

用AI写文章

11 条回复

切换为时间正序

请发表友善的回复…

发表回复

vc_nj 2010-10-25

打赏
举报

学习了这个方法,但是不知道HasString里的种子seed1,seed2怎么确定数字的,应该不是随机定的,定这些值是用什么方法,很想知道这个思想

vc_nj 2010-10-23

打赏
举报

收藏了，谢谢楼主分享好东西,研究一下

yezeguo 2009-04-07

打赏
举报

请问哈希构造方法中 RSHash 的思想？

chenzhiyubuaa 2008-01-14

打赏
举报

虽然有点跑题，可是我觉得字符串匹配用kmp算法会更好些

netxuning 2008-01-14

打赏
举报

用一个静态数组给你简单模拟一下:

#include <stdio.h>

#define HASH_TABLE_SIZE 13 //哈希表的大小应是个质数
struct mapping
{
void *key;
void *data;
} hash_table[HASH_TABLE_SIZE];

unsigned int
RSHash (char *str)
{
unsigned int b = 378551;
unsigned int a = 63689;
unsigned int hash = 0 ;

while (*str)
{
hash = hash * a + (*str++);
a *= b;
}
return (hash & 0x7FFFFFFF);
}

int
main ()
{
char *str = "we are the world!";
char *filename = "myfile.txt";
unsigned int hash_offset;
//初始化哈希表
memset (hash_table, 0x0, sizeof (hash_table));

//将字符串插入哈希表.
hash_offset = RSHash (str) % HASH_TABLE_SIZE;
hash_table[hash_offset].key = str;
hash_table[hash_offset].data = filename;

//查找str是否存在于hash_table.
hash_offset = RSHash (str) % HASH_TABLE_SIZE;
if (hash_table[hash_offset].key)
printf ("string '%s' exists in the file %s.\n", str, hash_table[hash_offset].data);
else
printf ("string '%s' does not exist.\n", str);
}

这个没有哈希冲突处理,楼主可以自己实现一下

goodluckyxl 2008-01-13

打赏
举报

大哥啊hash公示可以正推可以求逆
不明白的我建议看看暴雪公司有个经典的字符串的hash公式
你搜索一下

chlaws 2008-01-13

打赏
举报

这是数据结构里面的吧。
在查找那章节，对哈希查找与构造有详细讲解，不知楼主是否看过。

珍惜生命远离CPP 2008-01-13

打赏
举报

存储后的是无法查找的.:D

cunsh 2008-01-13

打赏
举报

mark
xuexi;

我啃 2008-01-13

打赏
举报

物质-》无知

我啃 2008-01-13

打赏
举报

BS一下自己的物质，支持一下狗，同时贴出
《暴雪公司有个经典的字符串的hash公式》（网上搜的）

打造最快的Hash表(和Blizzard的对话)

開元最近学习了一下Blizzard的MPQ文件格式，颇有一些心得，其中一条就是对HastTable的理解，很想写出来给大家共享，感谢Justin Olbrantz的文章《Inside MoPaQ》，大多认识来源于此。

先提一个简单的问题，如果有一个庞大的字符串数组，然后给你一个单独的字符串，让你从这个数组中查找是否有这个字符串并找到它，你会怎么做？

有一个方法最简单，老老实实从头查到尾，一个一个比较，直到找到为止，我想只要学过程序设计的人都能把这样一个程序作出来，但要是有程序员把这样的程序交给用户，我只能用无语来评价，或许它真的能工作，但...也只能如此了。

最合适的算法自然是使用HashTable（哈希表），先介绍介绍其中的基本知识，所谓Hash，一般是一个整数，通过某种算法，可以把一个字符串"压缩" 成一个整数，这个数称为Hash，当然，无论如何，一个32位整数是无法对应回一个字符串的，但在程序中，两个字符串计算出的Hash值相等的可能非常小，下面看看在MPQ中的Hash算法

unsigned long HashString(char *lpszFileName, unsigned long dwHashType)
{
unsigned char *key = (unsigned char *)lpszFileName;
unsigned long seed1 = 0x7FED7FED, seed2 = 0xEEEEEEEE;
int ch;

while(*key != 0)
{
ch = toupper(*key++);

seed1 = cryptTable[(dwHashType << 8) + ch] ^ (seed1 + seed2);
seed2 = ch + seed1 + seed2 + (seed2 << 5) + 3;
}
return seed1;
}

Blizzard的这个算法是非常高效的，被称为"One-Way Hash"，举个例子，字符串"unitneutralacritter.grp"通过这个算法得到的结果是0xA26067F3。
是不是把第一个算法改进一下，改成逐个比较字符串的Hash值就可以了呢，答案是，远远不够，要想得到最快的算法，就不能进行逐个的比较，通常是构造一个哈希表(Hash Table)来解决问题，哈希表是一个大数组，这个数组的容量根据程序的要求来定义，例如1024，每一个Hash值通过取模运算 (mod)对应到数组中的一个位置，这样，只要比较这个字符串的哈希值对应的位置又没有被占用，就可以得到最后的结果了，想想这是什么速度？是的，是最快的O(1)，现在仔细看看这个算法吧
int GetHashTablePos(char *lpszString, SOMESTRUCTURE *lpTable, int nTableSize)
{
int nHash = HashString(lpszString), nHashPos = nHash % nTableSize;

if (lpTable[nHashPos].bExists && !strcmp(lpTable[nHashPos].pString, lpszString))
return nHashPos;
else
return -1; //Error value
}

看到此，我想大家都在想一个很严重的问题："如果两个字符串在哈希表中对应的位置相同怎么办？",毕竟一个数组容量是有限的，这种可能性很大。解决该问题的方法很多，我首先想到的就是用"链表",感谢大学里学的数据结构教会了这个百试百灵的法宝，我遇到的很多算法都可以转化成链表来解决，只要在哈希表的每个入口挂一个链表，保存所有对应的字符串就OK了。

事情到此似乎有了完美的结局，如果是把问题独自交给我解决，此时我可能就要开始定义数据结构然后写代码了。然而Blizzard的程序员使用的方法则是更精妙的方法。基本原理就是：他们在哈希表中不是用一个哈希值而是用三个哈希值来校验字符串。

中国有句古话"再一再二不能再三再四"，看来Blizzard也深得此话的精髓，如果说两个不同的字符串经过一个哈希算法得到的入口点一致有可能，但用三个不同的哈希算法算出的入口点都一致，那几乎可以肯定是不可能的事了，这个几率是1:18889465931478580854784，大概是10的 22.3次方分之一，对一个游戏程序来说足够安全了。

现在再回到数据结构上，Blizzard使用的哈希表没有使用链表，而采用"顺延"的方式来解决问题，看看这个算法：
int GetHashTablePos(char *lpszString, MPQHASHTABLE *lpTable, int nTableSize)
{
const int HASH_OFFSET = 0, HASH_A = 1, HASH_B = 2;
int nHash = HashString(lpszString, HASH_OFFSET);
int nHashA = HashString(lpszString, HASH_A);
int nHashB = HashString(lpszString, HASH_B);
int nHashStart = nHash % nTableSize, nHashPos = nHashStart;

while (lpTable[nHashPos].bExists)
{
if (lpTable[nHashPos].nHashA == nHashA && lpTable[nHashPos].nHashB == nHashB)
return nHashPos;
else
nHashPos = (nHashPos + 1) % nTableSize;

if (nHashPos == nHashStart)
break;
}

return -1; //Error value
}

1. 计算出字符串的三个哈希值（一个用来确定位置，另外两个用来校验)
2. 察看哈希表中的这个位置
3. 哈希表中这个位置为空吗？如果为空，则肯定该字符串不存在，返回
4. 如果存在，则检查其他两个哈希值是否也匹配，如果匹配，则表示找到了该字符串，返回
5. 移到下一个位置，如果已经越界，则表示没有找到，返回
6. 看看是不是又回到了原来的位置，如果是，则返回没找到
7. 回到3

怎么样，很简单的算法吧，但确实是天才的idea, 其实最优秀的算法往往是简单有效的算法，
Blizzard被称为最卓越的游戏制作公司，不愧于此。

windows 下编译好的 gperf 完美哈希函数生成器。对于给定的字符串列表，产生哈希函数和哈希表。产生的哈希表没有碰撞，并且查找时只需要一次字符串比较，相当迅速。

本资源为BT文件，下载速度快，如果P2P工具支持下载字幕可以进行下载 Coursera上的公开课，普林斯顿大学教授Robert Sedgewick主讲《Algorithms》算法 Java实现课程网站http://algs4.cs.princeton.edu/home/ 视频一个两部分，算法（一）主要集中在基础的数据结构、排序、查找算法。相关主题有：并查集算法，二分查找，栈，队列，背包，插入排序，选择排序，希尔排序，快速排序，三切分快排，归并排序，堆排序，二分堆，二分查找树，红黑树，链表，线性哈希表，Graham扫描，kd树。算法（二）主要讲解图论和字符串处理的相关算法。相关主题有：深度优先搜索，宽度优先搜索，拓扑排序，Kosaraju-Sharir算法，Kruskal算法，Prim算法，Dijkistra算法，Bellman-Ford算法, Ford-Fulkerson算法, LSD radix sort算法, MSD radix sort算法, 3-way radix 快排算法, 多路尝试法, 三元查找尝试法, Knuth-Morris-Pratt算法, Boyer-Moore算法, Rabin-Karp算法, 正则匹配, run-length编码, Huffman编码, LZW压缩, 还有Burrows-Wheeler变换。

课程亮点：课程培训详细的笔记以及实例代码，让学员开始掌握Redis知识点课程内容：第1章：Redis概述：Redis简介、Redis版本介绍、Redis安装与启动第2章：Redis命令：全局Key管理命令、数据类型的内部编码第3章：字符串类型：字符串各种操作命令、字符串命令时间复杂度、字符串应用场景、字符串内部编码第4章：哈希类型：哈希各种操作命令、哈希命令时间复杂度、哈希应用场景、哈希内部编码课程特色：笔记Redis数据库：用200多条笔记串连所有知识点，让学员从一点一滴积累，学习过程无压力笔记标题采用关键字标识法，帮助学员更加容易记住知识点笔记以超链接形式让知识点关联起来，形式知识体系采用先概念后实例再应用方式，知识点深入浅出提供授课内容笔记作为课后复习以及工作备查工具部分图表（电脑PC端查看）：

字符串，哈希，字符串哈希，匹配

哈希查找（hash）：哈希查找算法始终非常高效的查找算法，其时间复杂度在最好的情况下可以达到O（1），即使是比较坏的情况，时间复杂度也非常低，查找数据非常快。事物都有两面性，有优即有劣。虽然哈希查找非常高效，但是他的高效是以时间换空间的代价来实现的。在如今，空间问题我们很容易解决，比如加内存等。可是时间复杂度的提高就非常难，因此，在允许的情况下，如果可以选择空间换时间，那么我们就一般会选择牺牲空间换取时间上的高效。在这里，我通过查找一个字符串中字符出现的位置来描述一下哈希查找的基本思想。源字符串： “w