• <ins id="pjuwb"></ins>
    <blockquote id="pjuwb"><pre id="pjuwb"></pre></blockquote>
    <noscript id="pjuwb"></noscript>
          <sup id="pjuwb"><pre id="pjuwb"></pre></sup>
            <dd id="pjuwb"></dd>
            <abbr id="pjuwb"></abbr>
            隨筆 - 79  文章 - 58  trackbacks - 0
            <2012年12月>
            2526272829301
            2345678
            9101112131415
            16171819202122
            23242526272829
            303112345

            常用鏈接

            留言簿(9)

            隨筆分類

            隨筆檔案

            文章檔案

            相冊

            搜索

            •  

            積分與排名

            • 積分 - 295382
            • 排名 - 87

            最新評論

            閱讀排行榜

            評論排行榜

            預處理主要就是建立兩個索引
            (1)網頁索引(通過URL知道網頁保存在本地哪里)

            (2)對網頁內容進行分詞然后建立倒排索引


            分詞的方法:

            (1)基本的詞典(中文比英文復雜多了,英文有空格來區分詞語)

            (2)使用字符串匹配(正向最大匹配,逆向最大匹配,最少切分),一般使用逆向最大匹配.
            (3)使用統計的方式來確定新詞,即相鄰的字共現的頻率越大,越有可能是新詞


            建立倒排索引:
            (1)分析網頁,去除html標簽,提取正文信息
            (2)分詞,然后以詞為索引建立倒排文件.


             

             

             

            posted on 2008-03-05 23:10 merlinfang 閱讀(757) 評論(0)  編輯 收藏 引用 所屬分類: 搜索引擎
            亚洲国产成人久久精品99 | 久久精品国产亚洲精品2020| 国产精品久久久天天影视香蕉| 狠狠色婷婷久久一区二区三区| 狠色狠色狠狠色综合久久 | 久久久久久国产精品免费免费| 久久99国产综合精品| 国产美女久久精品香蕉69| 久久久久久久久久久久中文字幕| …久久精品99久久香蕉国产 | 国产精品美女久久久久 | 久久久久无码专区亚洲av| 香蕉久久永久视频| 久久久一本精品99久久精品66 | 亚洲色大成网站www久久九| 嫩草伊人久久精品少妇AV| 中文字幕久久波多野结衣av| 97精品国产91久久久久久| 久久精品二区| 久久久久99精品成人片试看| 久久国产一片免费观看| 国内精品久久久久久久久电影网 | 国产精品美女久久久| 精品久久人人妻人人做精品| 久久精品国产亚洲av麻豆图片| 久久综合给合久久国产免费| 久久91精品综合国产首页| 久久人妻无码中文字幕| 久久se这里只有精品| 国产精品美女久久久久| 国内高清久久久久久| 国产香蕉97碰碰久久人人| 久久99热只有频精品8| 久久亚洲AV无码精品色午夜麻豆 | 亚洲伊人久久精品影院| 久久精品国产精品亚洲人人| 久久久久女人精品毛片| 中文字幕久久精品无码| 久久午夜福利无码1000合集| 欧美久久综合九色综合| 久久精品无码一区二区app|