亚洲香蕉成人av网站在线观看_欧美精品成人91久久久久久久_久久久久久久久久久亚洲_热久久视久久精品18亚洲精品_国产精自产拍久久久久久_亚洲色图国产精品_91精品国产网站_中文字幕欧美日韩精品_国产精品久久久久久亚洲调教_国产精品久久一区_性夜试看影院91社区_97在线观看视频国产_68精品久久久久久欧美_欧美精品在线观看_国产精品一区二区久久精品_欧美老女人bb

首頁 > 編程 > JavaScript > 正文

神級程序員JavaScript300行代碼搞定漢字轉拼音

2019-11-19 16:32:29
字體:
來源:轉載
供稿:網友

一.漢字轉拼音的現狀

首先應該說,漢字轉拼音是個強需求,比如聯系人按拼音字母排序/篩選;比如目的地(典型如機票購買)
按拼音首字母分類等等。但是這個需求的解決方案,但好像沒聽過什么巧妙的實現(特別是瀏覽器端),大概都需要一個龐大的字典。
具體到JavaScript,查查github和npm,比較優秀的處理漢字轉拼音的庫有pinyin
和pinyinjs,可以看到,兩者都自帶了龐大的字典。
這些字典動輒幾十上百KB(有的甚至幾MB),想在瀏覽器端使用還是需要一些勇氣的。所以當我們碰到漢字轉拼音的需求,也不怪我們第一反應就是拒絕需求(或者服務端實現)。
現在,如果我告訴你可以瀏覽器端300行代碼實現漢字轉拼音,是不是不可置信?

二.從安卓4.2.2聯系人代碼說起

再次強調這篇博客――利用Android源碼,輕松實現漢字轉拼音功能。
今天和大家分享一個從Android系統源代碼提取出來的漢字轉成拼音實現方案,只要一個類,560多行代碼就可以讓你輕松實現漢字轉成拼音的功能,且無需其他任何第三方依賴。
是不是打破了你的思維定勢:難道有什么強大的算法可以拋棄字典?
第一遍看完博客,稍有些失望,并沒有什么算法解析,只是介紹了從安卓代碼發現的這幾百行代碼。第二遍時帶著移植到JavaScript的想法閱讀代碼,算是弄懂了原理,于是開始了踩坑的移植之旅。

三.手把手教你300行JavaScript代碼實現漢字轉拼音

首先直指核心:為什么有漢字轉拼音必須有龐大字典的思維定勢?
因為漢字的排布和拼音并有什么關聯,比如在漢字區間/u4E00-/u9FFF,前一個可能是ha,后一個可能就是ze,沒有辦法從漢字的unicode關聯到拼音,所以只能有一個龐大的字典記錄每個漢字(或常用漢字)的拼音。
但是,假設我們可以把所有漢字按拼音排序,比如按'A','AI','AN','ANG','AO','BA',...,'ZUI','ZUN','ZUO'排序,那么,我們只需要記住每個相同拼音的漢字隊列的第一個漢字就好了。那么,所需要的字典就會很小(覆蓋所有拼音即可,拼音數量本身不多)。
現在,難點就是把漢字按拼音排序了。很幸運,ICU/本地化相關的API提供了這個排序API(如果沒有方便的排序/比較方法,那么本篇文章可能就不會出現了)。

所以,這就是為什么300行可以實現漢字轉拼音:Intl.CollatorAPI:Intl.Collator內部實現了本土化相關的字符串排序。我們通過Intl.Collator.prototype.compare可以把所有漢字基本按照拼音來排序。
邊界漢字表:記錄了排序的邊界點。該漢字表的每個漢字都是排序后相同拼音的漢字集合的首個漢字(Eachunihansisthefirstonewithinsamepinyinwhencollatoriszh_CN)。
說到這里,可能仍然有沒說清楚的地方,所以直接上一段代碼:

 

有興趣的同學可以執行node--icu-data-dir=node_modules/full-icu上面的腳本.js看看,然后看看是不是得到了基本按照拼音排序的漢字表。

這里有幾點要注意:

我再次加粗了“基本”,因為我們得到的漢字列表并沒有完全按照拼音來排序,中間偶爾有一些其它拼音的漢字插入,這點在制作邊界表時要額外注意。
上面腳本里得出的表是所有漢字的排序,其中有些和安卓代碼里HanziToPinyin.java的表有不同,所以需要更新HanziToPinyin.java的表。(從Java轉到JavaScript的最大的坑和工作量:更正邊界表)
相信大家都看到了核心代碼:constCOLLATOR=newIntl.Collator(['zh-Hans-CN']),Intl.Collator
(這里指定locale是中國zh-Hans-CN)正是能把漢字按拼音排序的關鍵,它是按locale-specific順序,排序字符串的InternationalizationAPI。
執行腳本時請先npmifull-icu,這個依賴會自動安裝缺失的中文支持并提示如何指定ICU數據文件來執行腳本。
1.ICUICU即InternationalComponentsforUnicode,為應用提供Unicode和國際化支持。
ICUisamature,widelyusedsetofC/C++andJavalibrariesprovidingUnicodeandGlobalizationsupportforsoftwareapplications.ICUiswidelyportableandgivesapplicationsthesameresultsonallplatformsandbetweenC/C++andJavasoftware.
并且ICU提供了本地化字符串比較服務(UnicodeCollationAlgorithm+本地特定的比較規則):
Collation:Comparestringsaccordingtotheconventionsandstandardsofaparticularlanguage,regionorcountry.ICU'scollationisbasedontheUnicodeCollationAlgorithmpluslocale-specificcomparisonrulesfromtheCommonLocaleDataRepository,acomprehensivesourceforthistypeofdata.
在現代瀏覽器上,一般ICU內置了對用戶本地語言的支持,我們直接使用即可。
但對node.js來說,通常情況下,ICU只包含了一個子集(通常是英語),所以我們需要自行添加對中文的支持。一般來說,可以通過npminstallfull-icu安裝full-icu
來安裝缺失的中文支持。(參見上面node--icu-data-dir=node_modules/full-icu)。
2.IntlAPI上一小節應該基本講清楚了國際化/本地化相關的知識,這里再補充一下內置API的使用。怎么查看用戶語言和Runtime是否支持這個語言?Intl.Collator.supportedLocalesOf(array|string)
返回包含支持(不用回退到默認locale)的locales的數組,參數可以是數組或字符串,為想要測試的locales(即BCP47languagetag)。

構造Collator對象和排序字符串

通過Intl.Collator.prototype.compare,我們可以按語言指定的順序來排序字符串。而中文中,這個排序恰好絕大多數都是按拼音的順序來的,'A','AI','AN','ANG','AO','BA','BAI','BAN','BANG','BAO','BEI','BEN','BENG','BI','BIAN','BIAO','BIE','BIN','BING','BO','BU','CA','CAI','CAN',...
,這正是我們上面提到的漢字轉拼音的關鍵。

四.邊界表更正

 顯然,這個邊界表是有問題的,需要更正。
我們可看到,大部分的漢字被轉成了qing,可見,qing這個拼音對應的漢字有問題。
找到這個漢字,是'/u72c5'/'亚洲香蕉成人av网站在线观看_欧美精品成人91久久久久久久_久久久久久久久久久亚洲_热久久视久久精品18亚洲精品_国产精自产拍久久久久久_亚洲色图国产精品_91精品国产网站_中文字幕欧美日韩精品_国产精品久久久久久亚洲调教_国产精品久久一区_性夜试看影院91社区_97在线观看视频国产_68精品久久久久久欧美_欧美精品在线观看_国产精品一区二区久久精品_欧美老女人bb

色狠狠久久aa北条麻妃| 亚洲欧美日本精品| 欧美性猛交xxx| 日韩中文字幕在线看| 国产自产女人91一区在线观看| 91av免费观看91av精品在线| 久久久久久久久久久久av| 亚洲午夜精品久久久久久久久久久久| 国产成人精品免高潮在线观看| 亚洲淫片在线视频| 亚洲国产免费av| 亚洲va久久久噜噜噜久久天堂| 亚洲高清免费观看高清完整版| 亚洲国产91色在线| www.99久久热国产日韩欧美.com| 久久精品国产成人精品| 成人有码在线视频| 自拍偷拍亚洲在线| 国内精品小视频在线观看| 日韩欧美aⅴ综合网站发布| 日韩精品在线播放| 91免费看片网站| 亚洲影视中文字幕| 欧美激情精品久久久久久大尺度| 久久久999成人| 亚洲高清久久久久久| 日韩中文字幕在线观看| 日韩久久精品成人| 亚洲综合在线中文字幕| 国产精品亚洲片夜色在线| 亚洲欧洲在线观看| 国内免费精品永久在线视频| 久久久久久国产| 亚洲精品一区二三区不卡| 日韩美女视频免费在线观看| 欧美大片在线免费观看| 在线精品播放av| 国产成人免费av| 在线观看国产精品淫| 中文字幕欧美日韩| 精品国产区一区二区三区在线观看| 夜夜嗨av色一区二区不卡| 国产精品久久久久久搜索| 成人欧美一区二区三区黑人| 尤物精品国产第一福利三区| 欧美日韩在线免费| 国产精品色午夜在线观看| 日韩高清电影免费观看完整版| 欧美一级黑人aaaaaaa做受| 国模视频一区二区| 51精品在线观看| 亚洲国产高清福利视频| 成人免费网站在线| 久久精品免费电影| 欧美成人一区在线| 国产一区二区三区在线观看视频| 日韩毛片中文字幕| 久久久精品久久久| 日韩有码片在线观看| 91人人爽人人爽人人精88v| 日韩欧美在线视频日韩欧美在线视频| 国产精品女人网站| 亚洲人a成www在线影院| 亚洲在线www| 久久久精品一区二区三区| 91亚洲va在线va天堂va国| 在线成人一区二区| 久久精品男人天堂| 性日韩欧美在线视频| 91精品国产高清久久久久久| 午夜免费在线观看精品视频| 国产亚洲欧美另类中文| 亚洲精品日韩欧美| 国产日产久久高清欧美一区| 成人黄色av网| 啊v视频在线一区二区三区| 日韩av在线网址| 午夜欧美大片免费观看| 色综合伊人色综合网| 亚洲国产成人久久| 久久视频精品在线| 欧美激情视频三区| 色一区av在线| 亚洲成av人乱码色午夜| 久久久久久这里只有精品| 欧美成人激情图片网| 国内精品视频久久| 欧美日韩国产第一页| 亚洲人成电影网站色…| 91视频国产精品| 在线精品视频视频中文字幕| 欧美成人自拍视频| 亚洲视频电影图片偷拍一区| www国产精品com| 国产欧美一区二区三区在线| 日韩电影免费在线观看中文字幕| 精品无码久久久久久国产| 亚洲日韩中文字幕在线播放| 91网站免费看| 欧美激情影音先锋| 日韩美女在线观看| 91精品久久久久久久久久入口| 国产成人精品日本亚洲| 国产91网红主播在线观看| 欧美孕妇孕交黑巨大网站| 亚洲毛茸茸少妇高潮呻吟| 久久97精品久久久久久久不卡| 中文字幕亚洲在线| 国产激情视频一区| 国产一区二区三区直播精品电影| 欧美一级黄色网| 亚洲日韩第一页| 在线精品高清中文字幕| 国产精品久久久久久久一区探花| 国产一区二区丝袜高跟鞋图片| 一区二区三区黄色| 国内外成人免费激情在线视频| 国产成人综合精品在线| 欧美成在线观看| 国产精品久久久久久久7电影| 亚洲精品国产精品国自产观看浪潮| 日韩一区二区欧美| 亚洲激情视频在线播放| 欧美极品少妇与黑人| 97视频在线观看视频免费视频| 精品国产一区二区三区久久狼黑人| 欧美另类极品videosbestfree| 成人午夜高潮视频| 久久成人精品一区二区三区| 久久久久久久一区二区三区| 国产日韩欧美在线| 亚洲热线99精品视频| 中文字幕在线看视频国产欧美在线看完整| 亚洲午夜av电影| 26uuu国产精品视频| 午夜精品久久久久久99热软件| 亚洲精品免费一区二区三区| 亚洲美女视频网| 日韩网站在线观看| 91免费人成网站在线观看18| 久久久999成人| 欧美激情视频免费观看| 欧美性xxxx极品hd欧美风情| 91久久精品国产91久久性色| 日韩一区二区欧美| 日韩欧美在线视频观看| 亚洲欧美日韩中文在线制服| 中文字幕精品一区二区精品| 日韩经典中文字幕在线观看| 亚洲自拍小视频免费观看| 国产网站欧美日韩免费精品在线观看| 日韩av免费在线看| 久久久亚洲网站| 国产成人综合精品| 久久亚洲精品国产亚洲老地址| 国产99久久久欧美黑人| 中文字幕亚洲一区在线观看| 成人a在线观看| 中文字幕精品一区久久久久| 欧美日韩国产丝袜另类| 久久综合伊人77777尤物| 青青草国产精品一区二区| 久久av资源网站| 亚洲精品视频网上网址在线观看|