关于汉字的识别

chenhui19820211 2008-12-05 11:02:24
我想对一段文章进行分词,文章很长,所以想以句号作为标记,对每一句进行分词。但是有一个问题,我查找的是汉字的句号,因此是两字节,有时候会将前一个汉字的低字节和后一个汉字的高字节识别为句号。应该怎么处理 多谢了!!
...全文
148 8 打赏 收藏 转发到动态 举报
写回复
用AI写文章
8 条回复
切换为时间正序
请发表友善的回复…
发表回复
taifeng123 2008-12-05
  • 打赏
  • 举报
回复
我觉得用stl可以解决你的问题,将一个个汉字和各种标点符号独立保存,再用find()查询句号,
门后面的猫 2008-12-05
  • 打赏
  • 举报
回复
学习一下
chenhui19820211 2008-12-05
  • 打赏
  • 举报
回复
因为文章里面可能含有英文所以不能以两字节为单位查
oakfire 2008-12-05
  • 打赏
  • 举报
回复
你不是以两字节为单位从头查的么?
cabbageA 2008-12-05
  • 打赏
  • 举报
回复
就是把你的程序作成UNICODE程序,所有文字都是统一编码,所以不存在有些文字占用多个字节,有的只占用一个。
lsmdiao0812 2008-12-05
  • 打赏
  • 举报
回复
[Quote=引用 5 楼 cabbageA 的回复:]
有两个方法
1用unicode,非常简单的方法。
2在多字节的字符串的每一个char进行判断,判断是否是一个多字节字的一部分,如果是就跳过下一个字节,这样就不会英文跳跃两个了。
建议用1。
2的字符判断的区间可以到网上去查阅哦。
[/Quote]

你说的第一种方法没用过,不过第二种方法用过,而且可行,方法是:
先要知道你的文章编码,因为不同的编码汉字的前后两字节是不同的,然后一个字节一个字节遍历你的文章,看这个自己是英文字母还是汉字的前后两个字符
chenhui19820211 2008-12-05
  • 打赏
  • 举报
回复
麻烦楼上的朋友将unicode说的详细一点好吗,之前没有用过 多谢了
cabbageA 2008-12-05
  • 打赏
  • 举报
回复
有两个方法
1用unicode,非常简单的方法。
2在多字节的字符串的每一个char进行判断,判断是否是一个多字节字的一部分,如果是就跳过下一个字节,这样就不会英文跳跃两个了。
建议用1。
2的字符判断的区间可以到网上去查阅哦。

65,211

社区成员

发帖
与我相关
我的任务
社区描述
C++ 语言相关问题讨论,技术干货分享,前沿动态等
c++ 技术论坛(原bbs)
社区管理员
  • C++ 语言社区
  • encoderlee
  • paschen
加入社区
  • 近7日
  • 近30日
  • 至今
社区公告
  1. 请不要发布与C++技术无关的贴子
  2. 请不要发布与技术无关的招聘、广告的帖子
  3. 请尽可能的描述清楚你的问题,如果涉及到代码请尽可能的格式化一下

试试用AI创作助手写篇文章吧