為了用C++簡單實現bert模型地預處理,需要將中文字符串切割成單個中文漢字,網上沒有找到在GBK編碼下的C++版本,于是簡單地查了下資料,實現了個半成品。
GBK編碼
- ASCII碼
使用一個字節(0-255)中的(0-127)來編碼字符,(128-255)沒用。 - GB2312碼
當一個字節的值在0-127之間時,該字節完整地表示了ASCII字符;
當該字節的值在128-255之間時,繼續讀取下一個字節,用這兩個字節的值(按某種規則計算)表示一個字符。 - GBK碼
GB2312只用了2個字節所能表達空間的一部分,微軟繼編碼了另一部分得到GBK編碼(主要包括ASCII,中文簡體,中文繁體,日文) - ANSI碼
微軟在中國大陸采用GBK編碼,而在臺灣則采用Big5編碼(臺灣的GBK),微軟對這種不同地區采用的不同編碼方式統稱為ANSI碼(本地碼)
字符切割
- 判斷第一個字節小于0,將該字節和下一個字節組成字符,該方法需要保證輸入為合法的GBK字符。
void GBKString2TokenList(const std::string& _input_str , std::vector< std::string >& token_list)
{
const char* p = _input_str.c_str(); //游標
const char * const start_idx = p; //固定初始位置
unsigned int tmp_int = 0; //上一時刻,游標與固定初始位置的距離
while (*p) //字符串未結束
{
if ((*p<0)&&(*(p+1)<0) //可簡單當作中文等需要占據兩個字節的字符
{
p+=2;
}
else // 英文數字等僅占一個字節的字符
{
p++;
}
token_list.push_back(_input_str.substr( tmp_int, p - start_idx - tmp_int)); //取上次游標距離到本次游標距離之間的字符
tmp_int = p - start_idx; //更新上次游標距離
}
return;
}
- 事實上GBK對雙字節的區間規定更嚴格一些,如低字節在160-254之間,高字節在64-254之間等,有時間再研究下。