• <ins id="pjuwb"></ins>
    <blockquote id="pjuwb"><pre id="pjuwb"></pre></blockquote>
    <noscript id="pjuwb"></noscript>
          <sup id="pjuwb"><pre id="pjuwb"></pre></sup>
            <dd id="pjuwb"></dd>
            <abbr id="pjuwb"></abbr>
            隨筆 - 79  文章 - 58  trackbacks - 0
            <2007年6月>
            272829303112
            3456789
            10111213141516
            17181920212223
            24252627282930
            1234567

            常用鏈接

            留言簿(9)

            隨筆分類

            隨筆檔案

            文章檔案

            相冊

            搜索

            •  

            積分與排名

            • 積分 - 295952
            • 排名 - 87

            最新評論

            閱讀排行榜

            評論排行榜

            預(yù)處理主要就是建立兩個索引
            (1)網(wǎng)頁索引(通過URL知道網(wǎng)頁保存在本地哪里)

            (2)對網(wǎng)頁內(nèi)容進(jìn)行分詞然后建立倒排索引


            分詞的方法:

            (1)基本的詞典(中文比英文復(fù)雜多了,英文有空格來區(qū)分詞語)

            (2)使用字符串匹配(正向最大匹配,逆向最大匹配,最少切分),一般使用逆向最大匹配.
            (3)使用統(tǒng)計(jì)的方式來確定新詞,即相鄰的字共現(xiàn)的頻率越大,越有可能是新詞


            建立倒排索引:
            (1)分析網(wǎng)頁,去除html標(biāo)簽,提取正文信息
            (2)分詞,然后以詞為索引建立倒排文件.


             

             

             

            posted on 2008-03-05 23:10 merlinfang 閱讀(763) 評論(0)  編輯 收藏 引用 所屬分類: 搜索引擎
            日韩欧美亚洲综合久久影院d3| 久久精品国内一区二区三区| 久久综合综合久久97色| 亚洲狠狠婷婷综合久久蜜芽| 亚洲精品无码久久久久AV麻豆| 久久国产精品一区| 久久AAAA片一区二区| 久久久久久久久久免免费精品| 国产成人精品久久一区二区三区av | 亚洲午夜久久久久久噜噜噜| 办公室久久精品| 久久久久久狠狠丁香| 久久国产乱子伦精品免费强| 精品免费tv久久久久久久| 欧美精品久久久久久久自慰| 99久久精品国产一区二区| 久久久久久精品免费看SSS | 久久亚洲国产成人精品无码区| 久久亚洲精品中文字幕三区| 亚洲国产成人久久精品影视| 99精品伊人久久久大香线蕉| 欧美久久一级内射wwwwww.| 性做久久久久久久久| 亚洲综合伊人久久综合| 久久久久久久久无码精品亚洲日韩| 狠狠88综合久久久久综合网| 香港aa三级久久三级| 日本欧美国产精品第一页久久| 久久精品一区二区三区AV| 国产成人精品综合久久久久| 久久久久AV综合网成人| 久久99精品久久久久久水蜜桃 | 久久只有这里有精品4| 久久久久无码精品国产| 国产亚洲精久久久久久无码AV| 亚洲精品tv久久久久久久久久| 久久精品麻豆日日躁夜夜躁| 久久男人中文字幕资源站| 亚洲AV日韩AV永久无码久久| 精品久久综合1区2区3区激情| 欧美精品久久久久久久自慰|