• <ins id="pjuwb"></ins>
    <blockquote id="pjuwb"><pre id="pjuwb"></pre></blockquote>
    <noscript id="pjuwb"></noscript>
          <sup id="pjuwb"><pre id="pjuwb"></pre></sup>
            <dd id="pjuwb"></dd>
            <abbr id="pjuwb"></abbr>
            foxriver
            Keep It Simple and Stupid.
            posts - 12,  comments - 39,  trackbacks - 0

            當QQ群聊天記錄日積月累,達到一定數量級的時候,要查找某些單一文字,往往會花費10幾秒甚至幾分鐘才有反應。除去磁盤讀取的時間,是否對聊天記錄做一個全局索引也是個重要的優化,這篇文章就是為了優化文本查找速度,介紹一個最簡單的方法。

            試著把QQ每條聊天記錄看成SQL里單一記錄,對單條記錄做全文索引。這里用的方法是bit位快速匹配。假設一條聊天記錄是"test", 轉換成16進制,就是"74 65 73 74", 對單條記錄,定義196位bit空間(占用24字節),定義為數組A, 然后按bit層(注意不是字節)做or操作:  (A = A or N, 把A的第N個bit設置為1)

            初始狀態:
            A = 0;        // 【0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00】

            A = A or 0x74; // 【0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x10,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00】
            A = A or 0x65; // 【0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x20,0x00,0x10,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00】
            A = A or 0x73; // 【0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x20,0x00,0x18,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00】
            A = A or 0x74; // 【0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x20,0x00,0x18,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00】

            使用時,給需要查找的字符串建立相同大小的bit索引B,對查找數據"es"做相同處理:

            B = 0;
            B = B or 0x65; // 【0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x20,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00】
            B = B or 0x73; // 【0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x20,0x00,0x08,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00,0x00】

            然后把A和B做and操作,如果結果為空(完全沒有交集),則可以快速跳過這條記錄,而不用去判斷實際內容中是否包含了查找文本。

            if (B & A)
            {
              // 兩者索引存在交集,有一定的可能性,處理進一步文字查找操作。
            }
            else
            {
              // 兩者不可能有包含關系,直接跳過本條記錄內容,判斷數據庫下一條記錄。
            }

            原理很簡單,就是求兩者的交集,但往往簡單的索引,能帶來意想不到的速度提升。實際測試中,只要輸入的查找文本比較短小,大約30%~60%上下浮動的數據都能直接略過,大大節省了查找總耗時。

            本人實現中,中文的查找方法相當于兩個單字節的英文,為了最大效率利用空間,用算法把中文每個BYTE都壓縮在196bit之內。

            posted on 2011-01-14 01:22 foxriver 閱讀(2210) 評論(6)  編輯 收藏 引用

            FeedBack:
            # re: C++ 【原創算法】實現一個最簡單bit位全文查找索引。
            2011-01-14 09:30 | atyuwen
            你這個不就是bloom filter的山寨版么,而且hash時并沒有考慮到pattern中的字母順序,結果退化成了一個普通的字符集求交。  回復  更多評論
              
            # re: C++ 實現一個最簡單bit位全文查找索引。
            2011-01-14 09:42 | foxriver
            @atyuwen

            啥,已經有人實現過了?有點杯具,去找來bloom filter研究研究。  回復  更多評論
              
            # re: C++ 【山寨算法】實現一個最簡單bit位全文查找索引。
            2011-01-14 12:03 | waiting4you
            和布隆算法還是不太一樣的,有創意~~
            只是有個地方沒看懂,A = A or 0x74怎么運算呢?怎么得到...0x16...的?謝謝  回復  更多評論
              
            # re: C++ 【山寨算法】實現一個最簡單bit位全文查找索引。
            2011-01-14 14:28 | foxriver
            @waiting4you

            杯具,測試數據寫錯了,是十進制的結果,被我寫成了16進制,已經修正。感謝。  回復  更多評論
              
            # re: C++ 【山寨算法】實現一個最簡單bit位全文查找索引。
            2011-01-14 21:50 | qiuxiafei
            額 確實是bloomfilter....
            不過還是很贊 異曲同工  回復  更多評論
              
            # re: C++ 【山寨算法】實現一個最簡單bit位全文查找索引。
            2011-02-12 17:57 | 隨便寫寫~~
            @waiting4you
            嘗試做了下,還不錯~~

            public void or(byte[] input, byte index) {
            int move = index % 8;
            int fix = index / 8;
            input[fix] |= (byte)(1 << move);
            }

            public bool and(byte[] input1, byte[] input2) {
            for (int i = 0; i < input1.Length; i++) {
            int x = input1[i] & input2[i];
            if (x > 0)
            return true;
            }
            return false;
            }  回復  更多評論
              

            <2012年2月>
            2930311234
            567891011
            12131415161718
            19202122232425
            26272829123
            45678910

            常用鏈接

            留言簿(3)

            隨筆檔案

            文章檔案

            相冊

            1

            搜索

            •  

            最新評論

            閱讀排行榜

            評論排行榜

            青青热久久国产久精品 | 人妻无码αv中文字幕久久琪琪布| 久久青青草原亚洲av无码app| 国产—久久香蕉国产线看观看| 久久99精品久久久久婷婷| 久久国产欧美日韩精品| 一本色道久久88精品综合 | 四虎国产精品成人免费久久| 久久久久久a亚洲欧洲aⅴ| 国产精品美女久久久| 国内精品人妻无码久久久影院| 久久国产高潮流白浆免费观看| 亚洲av日韩精品久久久久久a | 久久人人青草97香蕉| 亚洲成人精品久久| 久久本道久久综合伊人| 色婷婷噜噜久久国产精品12p| 武侠古典久久婷婷狼人伊人| 人妻系列无码专区久久五月天| 亚洲欧洲中文日韩久久AV乱码| 日韩久久无码免费毛片软件| 国产精品99久久久久久宅男小说| 少妇无套内谢久久久久| 久久精品亚洲中文字幕无码麻豆| 国产91色综合久久免费分享| 国产成人无码精品久久久久免费| 91精品国产91久久久久久| 免费一级欧美大片久久网| 亚洲成色WWW久久网站| 免费观看成人久久网免费观看| 久久婷婷人人澡人人| 久久综合给久久狠狠97色 | 欧美亚洲色综久久精品国产| 久久99中文字幕久久| 亚洲精品综合久久| 精品久久久久久国产91| 亚洲伊人久久综合影院| 精品久久久久久成人AV| 亚洲午夜福利精品久久| 久久精品国产一区二区三区日韩| 亚洲人AV永久一区二区三区久久 |