频道导航

C将UTF-8字符串迭代或分割成符号数组？

2019-06-05 C&C++ 前端之家

前端之家收集整理的这篇文章主要介绍了C将UTF-8字符串迭代或分割成符号数组？，前端之家小编觉得挺不错的，现在分享给大家，也给大家做个参考。

搜索与UTF-8字符串或将其分割成UTF-8符号数组的平台和第三方库独立的方式.

请张贴一个代码段.

解决了：
C++ iterate or split UTF-8 string into array of symbols?

解决方法

如果我明白了,听起来你想要找到每个UTF-8字符的开始.如果是这样,那么解析它们是相当简单的(解释它们是另一回事).但是,涉及到的字节数有多少是由 RFC定义的：

Char. number range  |        UTF-8 octet sequence
   (hexadecimal)    |              (binary)
--------------------+---------------------------------------------
0000 0000-0000 007F | 0xxxxxxx
0000 0080-0000 07FF | 110xxxxx 10xxxxxx
0000 0800-0000 FFFF | 1110xxxx 10xxxxxx 10xxxxxx
0001 0000-0010 FFFF | 11110xxx 10xxxxxx 10xxxxxx 10xxxxxx

例如,如果lb具有UTF-8字符的第一个八位字节,我认为以下将确定涉及的八位字节数.

unsigned char lb;

if (( lb & 0x80 ) == 0 )          // lead bit is zero,must be a single ascii
   printf( "1 octet\n" );
else if (( lb & 0xE0 ) == 0xC0 )  // 110x xxxx
   printf( "2 octets\n" );
else if (( lb & 0xF0 ) == 0xE0 ) // 1110 xxxx
   printf( "3 octets\n" );
else if (( lb & 0xF8 ) == 0xF0 ) // 1111 0xxx
   printf( "4 octets\n" );
else
   printf( "Unrecognized lead byte (%02x)\n",lb );

最终,尽管如此,如果在另一篇文章中建议您使用现有的图书馆,您将会更加完美.上面的代码可以根据八位字节对字符进行分类,但是一旦完成,它们不会帮助“做任何事情”.

上一篇：objective-c – NSStatusItem在启动下一篇：C：获取文件大小不正确

猜你在找的C&C++相关文章

C++11新特性的一些用法举例②

/** C+⬑ * 默认成员函数原来C++类中，有6个默认成员函数：构造函数析...

作者：HJfjfK 时间：2024-09-28

C++特殊类的设计与单例模式

#pragma once // 1. 设计一个不能被拷贝的类/* 解析:拷贝只会放生在两个场景中：拷贝构造函...

作者：HJfjfK 时间：2024-09-28

C++11的类型转换

C类型转换 C语言:显式和隐式类型转换隐式类型转化：编译器在编译阶段自动进行，能转就转，...

作者：HJfjfK 时间：2024-09-28

C++异常的基本概念与用法

//异常的概念/*抛出异常后必须要捕获,否则终止程序(到最外层后会交给main管理,main的行为就...

作者：HJfjfK 时间：2024-09-28

C++的智能指针

#pragma once /*Smart pointer 智能指针;灵巧指针智能指针三大件//1.RAII//2.像指针一样使...

作者：HJfjfK 时间：2024-09-28

C++11标准库原子变量 <atomic> 梳理

目录<atomic>原子操作的概念CAS实现原理CAS操作的伪代码：使用CAS完成变量的...

作者：HJfjfK 时间：2024-09-28

C++11新特性的一些用法举例①

//字符串字面量/*常用:1.原始字符串字面量括号内保持原样输出没有转义字符,如n不再是换行...

作者：HJfjfK 时间：2024-09-28

C++11标准库条件变量 <condition_variable> 梳理

目录<condition_variable>condition_variable类类方法生产者消费者模型 -- ...

作者：HJfjfK 时间：2024-09-28

C++11智能指针 unique_ptr、shared_ptr/weak_ptr、make_shared、循环引用、定制删除器 (万字长文)

目录智能指针场景引入 - 为什么需要智能指针？内存泄漏什么是内存泄漏内存泄漏的危害内存泄...

作者：HJfjfK 时间：2024-09-28

/** 多态/动态调用 * * * 1.虚函数/虚拟函数 * 语法:在函数前面加上virtual * * 1.1虚函数...

作者：HJfjfK 时间：2024-09-28

编程分类

PHP Java Java SE Python C#C&C++Ruby VB asp.Net Go Perl netty Django Delphi Jsp .NET Core Spring Flask Springboot SpringMVC Lua Laravel Mybatis Asp Groovy ThinkPHP Yii swoole

最新文章