国产精品人妻无码久久久,欧美人与禽zzz0交酡免费下载,奶好涨公帮帮我

為了用C++簡單實現bert模型地預處理，需要將中文字符串切割成單個中文漢字，網上沒有找到在GBK編碼下的C++版本，于是簡單地查了下資料，實現了個半成品。

GBK編碼

ASCII碼
使用一個字節（0-255）中的（0-127）來編碼字符，（128-255）沒用。
GB2312碼
當一個字節的值在0-127之間時，該字節完整地表示了ASCII字符；
當該字節的值在128-255之間時，繼續讀取下一個字節，用這兩個字節的值(按某種規則計算)表示一個字符。
GBK碼
GB2312只用了2個字節所能表達空間的一部分，微軟繼編碼了另一部分得到GBK編碼（主要包括ASCII,中文簡體，中文繁體，日文）
ANSI碼
微軟在中國大陸采用GBK編碼，而在臺灣則采用Big5編碼(臺灣的GBK),微軟對這種不同地區采用的不同編碼方式統稱為ANSI碼(本地碼)

字符切割

判斷第一個字節小于0，將該字節和下一個字節組成字符，該方法需要保證輸入為合法的GBK字符。

void GBKString2TokenList(const std::string& _input_str , std::vector< std::string >& token_list)
{    
    const char* p = _input_str.c_str(); //游標
    const char * const start_idx = p; //固定初始位置
    unsigned int tmp_int = 0; //上一時刻，游標與固定初始位置的距離
    while (*p)  //字符串未結束
    {   
        if ((*p<0)&&(*(p+1)<0) //可簡單當作中文等需要占據兩個字節的字符
        {   
            p+=2;
        } 
        else // 英文數字等僅占一個字節的字符
        { 
            p++;
        }   
        token_list.push_back(_input_str.substr( tmp_int, p - start_idx - tmp_int)); //取上次游標距離到本次游標距離之間的字符
        tmp_int = p - start_idx; //更新上次游標距離
    }
    return;
}

事實上GBK對雙字節的區間規定更嚴格一些，如低字節在160-254之間，高字節在64-254之間等，有時間再研究下。

參考

https://xuexi.tutcw.com/js-bian-ma-ascii-gbk-utf/
http://airtrack.me/posts/2012/12/23/%E5%AD%97%E7%AC%A6%E7%BC%96%E7%A0%81/
https://www.jb51.net/article/36350.htm

三个男躁一个女,国精产品一区一手机的秘密,麦子交换系列最经典十句话,欧美国产综合欧美视频

C++ GBK編碼字符切割

C++ GBK編碼字符切割

GBK編碼

字符切割

參考

推薦閱讀更多精彩內容

三个男躁一个女,国精产品一区一手机的秘密,麦子交换系列最经典十句话,欧美 国产 综合 欧美 视频

C++ GBK編碼 字符切割

GBK編碼

字符切割

參考

推薦閱讀更多精彩內容

三个男躁一个女,国精产品一区一手机的秘密,麦子交换系列最经典十句话,欧美国产综合欧美视频

C++ GBK編碼字符切割