关于ASCI字符串与Unicode字符串的奇怪问题,很不解,请高手指点.

vincent_tam 2009-06-05 12:19:28
问题一:
void test0()
{
char str[] = "你好呀,这是一个测试";
FILE* pf = fopen("C:\\test.t","w");
fwrite(str,sizeof(char),strlen(str)+1,pf);
fclose(pf);
}

void test1()
{
wchar_t wstr[] = L"你好呀,这是一个测试";
FILE* pf = fopen("C:\\test.t","w");
fwrite(wstr,sizeof(wchar_t),wcslen(wstr)+1,pf);
fclose(pf);
}
调用test0时,写入的文件test.t大小为20字节,记事本打开,字符串正常.
调用test1时,写入的文件test.t大小为22字节,记事本打开,字符串乱码.
疑问:1.为什么test0时,我明明fwrite进去的是sizeof(char)*((strlen)+1) = 11字节,为什么却是20,就算系统自动将其转换为Unicode,加上'\0'应该是sizeof(wchar_t)*((strlen)+1) = 22呀?
2.为什么test1会乱码?大小是22字节,而不是跟test0一样的20字节?

问题二:
ASCI字符串与Unicode字符串的转换问题.
void test2()
{
char cstr[] = "你好呀";
wchar_t wstr[16];
MByteToWChar(cstr,wstr,strlen(cstr)); //在这设断点看到wstr是"你好呀",正常,但下面printf却乱码
// MByteToWChar将ASCI转换为Unicode的,函数应该没问题
wprintf(wstr);
}
test2中,如果将中文改为英文或数字,printf就正常了.这个我倒知道.

...全文
91 8 打赏 收藏 转发到动态 举报
写回复
用AI写文章
8 条回复
切换为时间正序
请发表友善的回复…
发表回复
vincent_tam 2009-06-05
  • 打赏
  • 举报
回复
因为项目需要,所以写个数据备份与恢复的程序.问题却出现了.
例如:备份时,将"你好hello"写入文件,因为是Unicode,所以用记事本打开时,毫无疑问的是"你好"乱码,"hello"为h e l l o".这正是我所要的,但是到了恢复数据时,我是以字节读取的,即fread(char缓冲区str,sizeof(char),len,f);
str[len] = '\0' //无论加不加终止符号都不行.这回想把char转换了wchar_t却怎么也不行了,MultiByteToWideChar也不行,自己实现转换也不行,反正就是英文能正常,中文死活不行.
liubuweiright 2009-06-05
  • 打赏
  • 举报
回复
不懂,帮顶

可能经过特殊处理,哈哈
vincent_tam 2009-06-05
  • 打赏
  • 举报
回复
void test3()
{
wchar_t wstr[] = L"你好吗?";
FILE* pf = fopen("C:\\test.t","w");
fwrite(wstr,sizeof(wchar_t),wcslen(wstr)+1,pf);
fclose(pf);
}
test3()写入到文件时,由于是汉字,所以用记事本打开文件是乱码.

void test4()
{
wchar_t wstr[64] = {0};
FILE* pf = fopen("C:\\test.t","r");
fseek(pf,0,SEEK_END);
int nSize = ftell(pf);
fseek(pf,0,SEEK_SET);
fread(wstr,sizeof(wchar_t),nSize/sizeof(wchar_t),pf);
fclose(pf);
// 此时wstr="你好吗?"
}
虽然test4()能再将把刚刚写入文件的内容正确读出来,但不满足我的需求.我要的是把文件的内容读取到一个
BYTE的缓冲区里面.必要时才将ASCI转换为Unicode输出.
void test5()
{
BYTE buf[64] = {0};
FILE* pf = fopen("C:\\test.t","r");
fseek(pf,0,SEEK_END);
int nSize = ftell(pf);
fseek(pf,0,SEEK_SET);
fread(buf,sizeof(BYTE),nSize,pf);
fclose(pf);
// 此时buf里面的内容是乱码的.如何再将其转换回wchar_t呢,MultiByteToWideChar不行呀
}
SoRoMan 2009-06-05
  • 打赏
  • 举报
回复
楼主的问题跟charset,encode/decode,locale,application(notepad,wprintf)等相关,其实是个说简单又不简单的问题,要弄清情况,最好调试代码。

简单来说下:首先,楼主当前系统的locale可能是中文,right?当前系统下很多application默认的encode/decode可能是GB2312,好了,
==========================
问题一:
void test0()
{
char str[] = "你好呀,这是一个测试";
FILE* pf = fopen("C:\\test.t","w");
fwrite(str,sizeof(char),strlen(str)+1,pf);
fclose(pf);
}

调用test0时,写入的文件test.t大小为20字节,记事本打开,字符串正常.

答:在中文locale下,输入"你好呀,这是一个测试"单字节字符串,内存中会以对应的encode(如GB2312)方式编码存储后,由fwrite写入文件。
,而中文locale上的notepad的能够识别GB2312,能够decode出来,所以显示正常。


疑问:1.为什么test0时,我明明fwrite进去的是sizeof(char)*((strlen)+1) = 11字节,为什么却是20,就算系统自动将其转换为Unicode,加上'\0'应该是sizeof(wchar_t)*((strlen)+1) = 22呀?


答:"你好呀,这是一个测试"中9个汉字的GB2312码占的空间为9*2=18byte,加上','对应的1个byte和结束符'/0'的1byte,总共20byte。

==========================

==========================
void test1()
{
wchar_t wstr[] = L"你好呀,这是一个测试";
FILE* pf = fopen("C:\\test.t","w");
fwrite(wstr,sizeof(wchar_t),wcslen(wstr)+1,pf);
fclose(pf);
}
调用test1时,写入的文件test.t大小为22字节,记事本打开,字符串乱码.

答:注意这回是宽字符串,内存中会以unicode编码直接存储,由fwrite写入文件。而中文locale上的notepad的没有去尝试用unicode编码方式解析,所以不能够decode出来,所以显示不正常。为什么notepad这么傻?因为其仅仅是个notepad。

佐证1:English locale上的notepad会尝试用unicode编码去解析,所以能够正常显示。
佐证2:使用更智能点的word吧,它在不能确定目标文件编码的情况下会供用户选择解码方式,选中unicode,显示正常了。
佐证3:如果手动在该文件前加上FF FE,即unicode编码前缀,告诉notepad这是个unicode码文件,那么中文locale下notepad显示正常。


2.为什么test1会乱码?大小是22字节,而不是跟test0一样的20字节?

答:乱码的原因见上,至于大小,unicode编码下每个字符2个,所以10*2+2=22.
==========================

==========================
问题二:
ASCI字符串与Unicode字符串的转换问题.
void test2()
{
char cstr[] = "你好呀";
wchar_t wstr[16];
MByteToWChar(cstr,wstr,strlen(cstr)); //在这设断点看到wstr是"你好呀",正常,但下面printf却乱码
// MByteToWChar将ASCI转换为Unicode的,函数应该没问题
wprintf(wstr);
}
test2中,如果将中文改为英文或数字,printf就正常了.这个我倒知道.

答:wprintf等的结果是和当前application的locale有关的,原因是其内部使用了API-WideCharToMultiByte,其使用了默认的locale与当前的locale不对应。 所以会显示乱码。

佐证:如果你是中文简体系统的话,在wprintf前加上setlocale(LC_ALL, "chs"); 显示就会正常了。

==========================
zshtiger2414 2009-06-05
  • 打赏
  • 举报
回复
你写的是UTF8的文件还是UTF16的阿!
估计是UTF16的。
这个时候你的文件中要加bom的,不加在显示的时候就是乱麻!
你用UE打开看一下,开头的两个Byte,好像是FF FE,要不就是FE FF
zhuweiping2003 2009-06-05
  • 打赏
  • 举报
回复
最近比较关注这样的帖子
crst_zh 2009-06-05
  • 打赏
  • 举报
回复
调用test0时,写入的文件test.t大小为20字节,记事本打开,字符串正常.
因为字符集的原因,默认的是MBCS(多字节字符集,中文占两字节,英文占1字节),
"你好呀,这是一个测试"; 9个汉字,一个标点,一共是19个字节,但是sizeof()为20,因为还有最后一个'\0'


调用test1时,写入的文件test.t大小为22字节,记事本打开,字符串乱码.
对于UNICODE字符集,每一个占两字节,所以一共是22字节,最后一个'\0'也占两字节。
wcslen(wstr)+1 = 11,这里已经不对了。,strlen()是字符的个数,字符和字节要却分开,这里一个字符占两字节。

疑问:1.为什么test0时,我明明fwrite进去的是sizeof(char)*((strlen)+1) = 11字节,为什么却是20,就算系统自动将其转换为Unicode,加上'\0'应该是sizeof(wchar_t)*((strlen)+1) = 22呀?
2.为什么test1会乱码?大小是22字节,而不是跟test0一样的20字节?
内容概要:本文系统研究了开关频率大于谐振频率(fs>fr)工况下,移相混合控制LLC谐振变换器在低压增益区域的工作特性,深入分析其在变频与移相结合控制模式下的调制机理、工作模态划分及损耗分布规律。通过Simulink平台构建高保真仿真模型,对变换器在不同负载和输入条件下的电压增益、转换效率、关键器件电压电流应力等性能指标进行了全面仿真验证,重点探讨了其在低增益区间的软开关实现能力与效率优化潜力,旨在提升LLC变换器在宽范围输入输出应用中的动态响应与能源转换效率。; 适合人群:从事电力电子变换器设计、高频电源开发及相关领域的高校研究生、科研院所研究人员及企业研发工程师,要求具备扎实的电路理论基础、电力电子技术知识以及一定的Simulink仿真能力。; 使用场景及目标:①深入理解LLC谐振变换器在fs>fr条件下采用移相混合控制的内在工作机理与模态转换过程;②掌握利用Simulink搭建复杂谐振变换器精确仿真模型的方法与技巧;③分析并优化低压增益区的增益特性与损耗构成,为设计高效率、高功率密度的软开关电源提供理论依据和数据支持; 阅读建议:建议读者结合文中所述仿真模型,亲自复现仿真过程,重点观察不同控制参数(如移相比、开关频率)对电压增益曲线和关键波形的影响,并对比传统变频控制策略,深入探究混合控制在拓宽调压范围、提升轻载效率方面的优势,从而深化对现代高效谐振电源设计的理解。
内容概要:本文提出了一种基于粒子群优化算法(PSO)的配电网光伏储能双层优化配置模型,以IEEE33节点系统为标准算例,实现光伏发电单元与储能系统的协同选址与定容优化。该模型采用双层架构设计,上层以投资成本、运行经济性及网络损耗最小为目标优化设备配置方案,下层通过潮流计算评估系统在不同负荷场景下的运行性能,综合考虑电压稳定性、供电可靠性及可再生能源消纳能力,最终通过Matlab编程实现完整求解流程,为高渗透率分布式电源接入背景下的配电网规划提供了有效的技术支撑。; 适合人群:具备电力系统分析基础和Matlab编程能力的研究生、高校科研人员及从事新能源并网、智能配电网规划与优化的工程技术人员。; 使用场景及目标:①研究含高比例光伏接入的配电网规划与运行协同优化问题;②掌握双层优化建模方法与粒子群算法在复杂电力系统问题中的应用技巧;③为实际工程中分布式光伏与储能系统的科学选址与容量配置提供理论依据与仿真验证平台。; 阅读建议:建议读者结合Matlab代码深入理解双层迭代求解机制,重点关注算法收敛性分析、参数敏感性测试,并可通过更换初始种群、调整权重因子或引入其他标准测试系统(如IEEE69节点)进行对比实验,进一步验证所提模型的普适性与鲁棒性。

65,210

社区成员

发帖
与我相关
我的任务
社区描述
C++ 语言相关问题讨论,技术干货分享,前沿动态等
c++ 技术论坛(原bbs)
社区管理员
  • C++ 语言社区
  • encoderlee
  • paschen
加入社区
  • 近7日
  • 近30日
  • 至今
社区公告
  1. 请不要发布与C++技术无关的贴子
  2. 请不要发布与技术无关的招聘、广告的帖子
  3. 请尽可能的描述清楚你的问题,如果涉及到代码请尽可能的格式化一下

试试用AI创作助手写篇文章吧