社区
Java SE
帖子详情
正则表达式匹配中文问题
soft53ears
2009-10-28 11:56:53
在正则中匹配中文是匹配的Unicode的编码\u4e00-\u9fa5
假如说出现了生僻字,会不会没有出现在这段编码之中呢???
那这样的话怎么判断是否为中文呢??
求解
...全文
230
16
打赏
收藏
正则表达式匹配中文问题
在正则中匹配中文是匹配的Unicode的编码\u4e00-\u9fa5 假如说出现了生僻字,会不会没有出现在这段编码之中呢??? 那这样的话怎么判断是否为中文呢?? 求解
复制链接
扫一扫
分享
转发到动态
举报
写回复
配置赞助广告
用AI写文章
16 条
回复
切换为时间正序
请发表友善的回复…
发表回复
打赏红包
tttiiillll
2012-04-06
打赏
举报
回复
“㛃”编码是36c3用正则表达式就无法检查出来
soft53ears
2009-11-04
打赏
举报
回复
前几天有点忙..没有来结贴.......不得不膜拜强大的火龙果...
onlyxing
2009-11-04
打赏
举报
回复
mark
szzxm
2009-10-29
打赏
举报
回复
学习学习,每天回复有10个可用分
summerXJY100
2009-10-29
打赏
举报
回复
\u4e00-\u9fa5
所有的中文
whb3118
2009-10-29
打赏
举报
回复
生僻字也是中文~!
你要写出阿拉伯文,就不是中文了。
py330316117
2009-10-29
打赏
举报
回复
没什么可说的了。。。(难道我也说不会,显而易见吗)
amdgaming
2009-10-29
打赏
举报
回复
不会的,这个 不用担心。。
coolbamboo2008
2009-10-29
打赏
举报
回复
mark,学习
johnston678
2009-10-29
打赏
举报
回复
学习中,还没怎么过匹配中文
lihao1129
2009-10-29
打赏
举报
回复
应该是所有的汉字,应该不会有问题的
loveofmylife
2009-10-29
打赏
举报
回复
这个是所有的汉字吧,应该不会有问题吧
如果真的有不能匹配在网上查一下它的unicode码
火龙果被占用了
2009-10-29
打赏
举报
回复
也可以使用 [\p{InCJK Unified Ideographs}&&\P{Cn}] 这个比较有扩展性,比如 Unicode 在 U+9FA6 新加了一个字的话,这也能匹配
苍蝇①号
2009-10-29
打赏
举报
回复
用utf-8全部问题不是问题
python入门—2常见
问题
_1_
正则表达式匹配
中文
python2.7 在使用正则表达式来匹配
中文
字符时,经常会出现意想不到的
问题
,比如下面这个匹配
问题
: 1、
问题
字符串: 飞利浦(PHILIPS) 飞利浦(PHILIPS) 飞利浦(PHILIPS) 飞利浦(PHILIPS) 从字符串中将"飞利浦"和"PHILIPS"提取出来。 注意:字符串中将"PHILIPS"括起来的括号有
中文
括号也有英
正则表达式匹配
中文
时发现的
问题
大家使用
正则表达式匹配
中文
时,常用 [\u4e00-\u9fa5] ,但有时使用 [\u4e00-\u9fa5] 匹配汉字时,发现有的汉字匹配不到,如: 㸌如 㔩叶 使用Python3测试: r = '[^\u4e00-\u9fa5]' #非汉字 for i in words: word = re.sub(r, '', i) #替换掉非汉字 if len(word) == 1:...
关于Notepad++中用
正则表达式匹配
中文
的
问题
通常
正则表达式匹配
中文
可以利用Unicode的特点,使用[\u4e00-\u9fa5]匹配。但在Notepad++中不能正常使用。 解决方法是,首先将编码转换成Unicode(菜单->格式->转换为UTF-8,如果不转换可能匹配出错),然后使用[\x{4e00}-\x{9fa5}]就可以实现匹配
中文
了。
mysql正则表达式
中文
匹配
问题
背景:匹配财产描述是否包含日期范围示例:重药控股吉林省天华医药有限公司在编号为XSHT-03-2021-612的项下,基于/在 2022年04月27日至2022年05月24日因履行合同义务而对辽源市妇婴医院产生的应收账款,金额 为人民币854,625.34元, 其他信息可详见附件。正常正则表达式写法:[0-9]{4}[\-/年][0-9]{2}[\-/月][0-9]{2}[日]?(\-至到)[0-9]{4}[\-/年][0-9]{2}[\-/月][0-9]{2}匹配结果:不匹配 原因分析...
Oracle
正则表达式匹配
中文
的
问题
查资料知道
中文
Unicode范围是\u4e00 - \u9fa5 可是自己用来
正则表达式匹配
中文
总是用不了Unicode。最简单举例:select regexp_replace('abc秋歌def','[\u4e00-\u9fa5]','-') from dual;结果是:-bc秋歌d-- 即将\u4e00-\u9fa5里面的a,b,e,f当成字符了。我用的是Oracle10....
Java SE
62,621
社区成员
307,251
社区内容
发帖
与我相关
我的任务
Java SE
Java 2 Standard Edition
复制链接
扫一扫
分享
社区描述
Java 2 Standard Edition
社区管理员
加入社区
获取链接或二维码
近7日
近30日
至今
加载中
查看更多榜单
社区公告
暂无公告
试试用AI创作助手写篇文章吧
+ 用AI写文章