关于ASCI字符串与Unicode字符串的奇怪问题,很不解,请高手指点.

vincent_tam 2009-06-05 12:19:28
问题一:
void test0()
{
char str[] = "你好呀,这是一个测试";
FILE* pf = fopen("C:\\test.t","w");
fwrite(str,sizeof(char),strlen(str)+1,pf);
fclose(pf);
}

void test1()
{
wchar_t wstr[] = L"你好呀,这是一个测试";
FILE* pf = fopen("C:\\test.t","w");
fwrite(wstr,sizeof(wchar_t),wcslen(wstr)+1,pf);
fclose(pf);
}
调用test0时,写入的文件test.t大小为20字节,记事本打开,字符串正常.
调用test1时,写入的文件test.t大小为22字节,记事本打开,字符串乱码.
疑问:1.为什么test0时,我明明fwrite进去的是sizeof(char)*((strlen)+1) = 11字节,为什么却是20,就算系统自动将其转换为Unicode,加上'\0'应该是sizeof(wchar_t)*((strlen)+1) = 22呀?
2.为什么test1会乱码?大小是22字节,而不是跟test0一样的20字节?

问题二:
ASCI字符串与Unicode字符串的转换问题.
void test2()
{
char cstr[] = "你好呀";
wchar_t wstr[16];
MByteToWChar(cstr,wstr,strlen(cstr)); //在这设断点看到wstr是"你好呀",正常,但下面printf却乱码
// MByteToWChar将ASCI转换为Unicode的,函数应该没问题
wprintf(wstr);
}
test2中,如果将中文改为英文或数字,printf就正常了.这个我倒知道.

...全文
93 8 打赏 收藏 转发到动态 举报
写回复
用AI写文章
8 条回复
切换为时间正序
请发表友善的回复…
发表回复
vincent_tam 2009-06-05
  • 打赏
  • 举报
回复
因为项目需要,所以写个数据备份与恢复的程序.问题却出现了.
例如:备份时,将"你好hello"写入文件,因为是Unicode,所以用记事本打开时,毫无疑问的是"你好"乱码,"hello"为h e l l o".这正是我所要的,但是到了恢复数据时,我是以字节读取的,即fread(char缓冲区str,sizeof(char),len,f);
str[len] = '\0' //无论加不加终止符号都不行.这回想把char转换了wchar_t却怎么也不行了,MultiByteToWideChar也不行,自己实现转换也不行,反正就是英文能正常,中文死活不行.
liubuweiright 2009-06-05
  • 打赏
  • 举报
回复
不懂,帮顶

可能经过特殊处理,哈哈
vincent_tam 2009-06-05
  • 打赏
  • 举报
回复
void test3()
{
wchar_t wstr[] = L"你好吗?";
FILE* pf = fopen("C:\\test.t","w");
fwrite(wstr,sizeof(wchar_t),wcslen(wstr)+1,pf);
fclose(pf);
}
test3()写入到文件时,由于是汉字,所以用记事本打开文件是乱码.

void test4()
{
wchar_t wstr[64] = {0};
FILE* pf = fopen("C:\\test.t","r");
fseek(pf,0,SEEK_END);
int nSize = ftell(pf);
fseek(pf,0,SEEK_SET);
fread(wstr,sizeof(wchar_t),nSize/sizeof(wchar_t),pf);
fclose(pf);
// 此时wstr="你好吗?"
}
虽然test4()能再将把刚刚写入文件的内容正确读出来,但不满足我的需求.我要的是把文件的内容读取到一个
BYTE的缓冲区里面.必要时才将ASCI转换为Unicode输出.
void test5()
{
BYTE buf[64] = {0};
FILE* pf = fopen("C:\\test.t","r");
fseek(pf,0,SEEK_END);
int nSize = ftell(pf);
fseek(pf,0,SEEK_SET);
fread(buf,sizeof(BYTE),nSize,pf);
fclose(pf);
// 此时buf里面的内容是乱码的.如何再将其转换回wchar_t呢,MultiByteToWideChar不行呀
}
SoRoMan 2009-06-05
  • 打赏
  • 举报
回复
楼主的问题跟charset,encode/decode,locale,application(notepad,wprintf)等相关,其实是个说简单又不简单的问题,要弄清情况,最好调试代码。

简单来说下:首先,楼主当前系统的locale可能是中文,right?当前系统下很多application默认的encode/decode可能是GB2312,好了,
==========================
问题一:
void test0()
{
char str[] = "你好呀,这是一个测试";
FILE* pf = fopen("C:\\test.t","w");
fwrite(str,sizeof(char),strlen(str)+1,pf);
fclose(pf);
}

调用test0时,写入的文件test.t大小为20字节,记事本打开,字符串正常.

答:在中文locale下,输入"你好呀,这是一个测试"单字节字符串,内存中会以对应的encode(如GB2312)方式编码存储后,由fwrite写入文件。
,而中文locale上的notepad的能够识别GB2312,能够decode出来,所以显示正常。


疑问:1.为什么test0时,我明明fwrite进去的是sizeof(char)*((strlen)+1) = 11字节,为什么却是20,就算系统自动将其转换为Unicode,加上'\0'应该是sizeof(wchar_t)*((strlen)+1) = 22呀?


答:"你好呀,这是一个测试"中9个汉字的GB2312码占的空间为9*2=18byte,加上','对应的1个byte和结束符'/0'的1byte,总共20byte。

==========================

==========================
void test1()
{
wchar_t wstr[] = L"你好呀,这是一个测试";
FILE* pf = fopen("C:\\test.t","w");
fwrite(wstr,sizeof(wchar_t),wcslen(wstr)+1,pf);
fclose(pf);
}
调用test1时,写入的文件test.t大小为22字节,记事本打开,字符串乱码.

答:注意这回是宽字符串,内存中会以unicode编码直接存储,由fwrite写入文件。而中文locale上的notepad的没有去尝试用unicode编码方式解析,所以不能够decode出来,所以显示不正常。为什么notepad这么傻?因为其仅仅是个notepad。

佐证1:English locale上的notepad会尝试用unicode编码去解析,所以能够正常显示。
佐证2:使用更智能点的word吧,它在不能确定目标文件编码的情况下会供用户选择解码方式,选中unicode,显示正常了。
佐证3:如果手动在该文件前加上FF FE,即unicode编码前缀,告诉notepad这是个unicode码文件,那么中文locale下notepad显示正常。


2.为什么test1会乱码?大小是22字节,而不是跟test0一样的20字节?

答:乱码的原因见上,至于大小,unicode编码下每个字符2个,所以10*2+2=22.
==========================

==========================
问题二:
ASCI字符串与Unicode字符串的转换问题.
void test2()
{
char cstr[] = "你好呀";
wchar_t wstr[16];
MByteToWChar(cstr,wstr,strlen(cstr)); //在这设断点看到wstr是"你好呀",正常,但下面printf却乱码
// MByteToWChar将ASCI转换为Unicode的,函数应该没问题
wprintf(wstr);
}
test2中,如果将中文改为英文或数字,printf就正常了.这个我倒知道.

答:wprintf等的结果是和当前application的locale有关的,原因是其内部使用了API-WideCharToMultiByte,其使用了默认的locale与当前的locale不对应。 所以会显示乱码。

佐证:如果你是中文简体系统的话,在wprintf前加上setlocale(LC_ALL, "chs"); 显示就会正常了。

==========================
zshtiger2414 2009-06-05
  • 打赏
  • 举报
回复
你写的是UTF8的文件还是UTF16的阿!
估计是UTF16的。
这个时候你的文件中要加bom的,不加在显示的时候就是乱麻!
你用UE打开看一下,开头的两个Byte,好像是FF FE,要不就是FE FF
zhuweiping2003 2009-06-05
  • 打赏
  • 举报
回复
最近比较关注这样的帖子
crst_zh 2009-06-05
  • 打赏
  • 举报
回复
调用test0时,写入的文件test.t大小为20字节,记事本打开,字符串正常.
因为字符集的原因,默认的是MBCS(多字节字符集,中文占两字节,英文占1字节),
"你好呀,这是一个测试"; 9个汉字,一个标点,一共是19个字节,但是sizeof()为20,因为还有最后一个'\0'


调用test1时,写入的文件test.t大小为22字节,记事本打开,字符串乱码.
对于UNICODE字符集,每一个占两字节,所以一共是22字节,最后一个'\0'也占两字节。
wcslen(wstr)+1 = 11,这里已经不对了。,strlen()是字符的个数,字符和字节要却分开,这里一个字符占两字节。

疑问:1.为什么test0时,我明明fwrite进去的是sizeof(char)*((strlen)+1) = 11字节,为什么却是20,就算系统自动将其转换为Unicode,加上'\0'应该是sizeof(wchar_t)*((strlen)+1) = 22呀?
2.为什么test1会乱码?大小是22字节,而不是跟test0一样的20字节?

65,211

社区成员

发帖
与我相关
我的任务
社区描述
C++ 语言相关问题讨论,技术干货分享,前沿动态等
c++ 技术论坛(原bbs)
社区管理员
  • C++ 语言社区
  • encoderlee
  • paschen
加入社区
  • 近7日
  • 近30日
  • 至今
社区公告
  1. 请不要发布与C++技术无关的贴子
  2. 请不要发布与技术无关的招聘、广告的帖子
  3. 请尽可能的描述清楚你的问题,如果涉及到代码请尽可能的格式化一下

试试用AI创作助手写篇文章吧