青青草原综合久久大伊人导航_色综合久久天天综合_日日噜噜夜夜狠狠久久丁香五月_热久久这里只有精品

隨筆 - 87  文章 - 279  trackbacks - 0
<2025年11月>
2627282930311
2345678
9101112131415
16171819202122
23242526272829
30123456

潛心看書研究!

常用鏈接

留言簿(19)

隨筆分類(81)

文章分類(89)

相冊

ACM OJ

My friends

搜索

  •  

積分與排名

  • 積分 - 220432
  • 排名 - 118

最新評論

閱讀排行榜

評論排行榜

數(shù)學之美 系列九 -- 如何確定網(wǎng)頁和查詢的相關性



[我們已經(jīng)談過了如何自動下載網(wǎng)頁如何建立索引如何衡量網(wǎng)頁的質量(Page Rank)。我們今天談談如何確定一個網(wǎng)頁和某個查詢的相關性。了解了這四個方面,一個有一定編程基礎的讀者應該可以寫一個簡單的搜索引擎了,比如為您所在的學校或院系建立一個小的搜索引擎。]

我們還是看上回的例子,查找關于“原子能的應用”的網(wǎng)頁。我們第一步是在索引中找到包含這三個詞的網(wǎng)頁(詳見關于布爾運算的系列)。現(xiàn)在任何一個搜索引擎都包含幾十萬甚至是上百萬個多少有點關系的網(wǎng)頁。那么哪個應該排在前面呢?顯然我們應該根據(jù)網(wǎng)頁和查詢“原子能的應用”的相關性對這些網(wǎng)頁進行排序。因此,這里的關鍵問題是如何度量網(wǎng)頁和查詢的相關性。

我們知道,短語“原子能的應用”可以分成三個關鍵詞:原子能、的、應用。根據(jù)我們的直覺,我們知道,包含這三個詞多的網(wǎng)頁應該比包含它們少的網(wǎng)頁相關。當然,這個辦法有一個明顯的漏洞,就是長的網(wǎng)頁比短的網(wǎng)頁占便宜,因為長的網(wǎng)頁總的來講包含的關鍵詞要多些。因此我們需要根據(jù)網(wǎng)頁的長度,對關鍵詞的次數(shù)進行歸一化,也就是用關鍵詞的次數(shù)除以網(wǎng)頁的總字數(shù)。我們把這個商稱為“關鍵詞的頻率”,或者“單文本詞匯頻率”(Term Frequency),比如,在某個一共有一千詞的網(wǎng)頁中“原子能”、“的”和“應用”分別出現(xiàn)了 2 次、35 次 和 5 次,那么它們的詞頻就分別是 0.002、0.035 和 0.005。 我們將這三個數(shù)相加,其和 0.042 就是相應網(wǎng)頁和查詢“原子能的應用”
相關性的一個簡單的度量。概括地講,如果一個查詢包含關鍵詞 w1,w2,...,wN, 它們在一篇特定網(wǎng)頁中的詞頻分別是: TF1, TF2, ..., TFN。 (TF: term frequency)。 那么,這個查詢和該網(wǎng)頁的相關性就是:
TF1 + TF2 + ... + TFN。

讀者可能已經(jīng)發(fā)現(xiàn)了又一個漏洞。在上面的例子中,詞“的”站了總詞頻的 80% 以上,而它對確定網(wǎng)頁的主題幾乎沒有用。我們稱這種詞叫“應刪除詞”(Stopwords),也就是說在度量相關性是不應考慮它們的頻率。在漢語中,應刪除詞還有“是”、“和”、“中”、“地”、“得”等等幾十個。忽略這些應刪除詞后,上述網(wǎng)頁的相似度就變成了0.007,其中“原子能”貢獻了0.002,“應用”貢獻了 0.005。

細心的讀者可能還會發(fā)現(xiàn)另一個小的漏洞。在漢語中,“應用”是個很通用的詞,而“原子能”是個很專業(yè)的詞,后者在相關性排名中比前者重要。因此我們需要給漢語中的每一個詞給一個權重,這個權重的設定必須滿足下面兩個條件:

1. 一個詞預測主題能力越強,權重就越大,反之,權重就越小。我們在網(wǎng)頁中看到“原子能”這個詞,或多或少地能了解網(wǎng)頁的主題。我們看到“應用”一次,對主題基本上還是一無所知。因此,“原子能“的權重就應該比應用大。

2. 應刪除詞的權重應該是零。

我們很容易發(fā)現(xiàn),如果一個關鍵詞只在很少的網(wǎng)頁中出現(xiàn),我們通過它就容易鎖定搜索目標,它的權重也就應該大。反之如果一個詞在大量網(wǎng)頁中出現(xiàn),我們看到它仍然不很清楚要找什么內容,因此它應該小。概括地講,假定一個關鍵詞 w 在 Dw 個網(wǎng)頁中出現(xiàn)過,那么 Dw 越大,w 的權重越小,反之亦然。在信息檢索中,使用最多的權重是“逆文本頻率指數(shù)” (Inverse document frequency 縮寫為IDF),它的公式為log(D/Dw)其中D是全部網(wǎng)頁數(shù)。比如,我們假定中文網(wǎng)頁數(shù)是D=10億,應刪除詞“的”在所有的網(wǎng)頁中都出現(xiàn),即Dw=10億,那么它的IDF=log(10億/10億)= log (1) = 0。假如專用詞“原子能”在兩百萬個網(wǎng)頁中出現(xiàn),即Dw=200萬,則它的權重IDF=log(500) =6.2。又假定通用詞“應用”,出現(xiàn)在五億個網(wǎng)頁中,它的權重IDF = log(2)
則只有 0.7。也就只說,在網(wǎng)頁中找到一個“原子能”的比配相當于找到九個“應用”的匹配。利用 IDF,上述相關性計算個公式就由詞頻的簡單求和變成了加權求和,即 TF1*IDF1 + TF2*IDF2 +... + TFN*IDFN。在上面的例子中,該網(wǎng)頁和“原子能的應用”的相關性為 0.0161,其中“原子能”貢獻了 0.0126,而“應用”只貢獻了0.0035。這個比例和我們的直覺比較一致了。

TF/IDF(term frequency/inverse document frequency) 的概念被公認為信息檢索中最重要的發(fā)明。在搜索、文獻分類和其他相關領域有廣泛的應用。講起 TF/IDF 的歷史蠻有意思。IDF 的概念最早是劍橋大學的斯巴克-瓊斯[注:她有兩個姓] (Karen Sparck Jones)提出來的。斯巴克-瓊斯 1972 年在一篇題為關鍵詞特殊性的統(tǒng)計解釋和她在文獻檢索中的應用的論文中提出IDF。遺憾的是,她既沒有從理論上解釋為什么權重IDF 應該是對數(shù)函數(shù) log(D/Dw)(而不是其它的函數(shù),比如平方根),也沒有在這個題目上作進一步深入研究,以至于在以后的很多文獻中人們提到 TF/IDF 時沒有引用她的論文,絕大多數(shù)人甚至不知道斯巴克-瓊斯的貢獻。同年羅賓遜寫了個兩頁紙的解釋,解釋得很不好。倒是后來康乃爾大學的薩爾頓(Salton)多次寫文章、寫書討論 TF/IDF 在信息檢索中的用途,加上薩爾頓本人的大名(信息檢索的世界大獎就是以薩爾頓的名字命名的)。很多人都引用薩爾頓的書,甚至以為這個信息檢索中最重要的概念是他提出的。當然,世界并沒有忘記斯巴克-瓊斯的貢獻,2004年,在紀念文獻學學報創(chuàng)刊 60 周年之際,該學報重印了斯巴克-瓊斯的大作。羅賓遜在同期期刊上寫了篇文章,用香農(nóng)的信息論解釋 IDF,這回的解釋是對的,但文章寫的并不好、非常冗長(足足十八頁),把一個簡單問題搞復雜了。其實,信息論的學者們已經(jīng)發(fā)現(xiàn)并指出,其實 IDF 的概念就是一個特定條件下、關鍵詞的概率分布的交叉熵(Kullback-Leibler Divergence)(詳見上一系列)。這樣,信息檢索相關性的度量,又回到了信息論。

現(xiàn)在的搜索引擎對 TF/IDF 進行了不少細微的優(yōu)化,使得相關性的度量更加準確了。當然,對有興趣寫一個搜索引擎的愛好者來講,使用 TF/IDF 就足夠了。 如果我們結合上網(wǎng)頁排名(Page Rank),那么給定一個查詢,有關網(wǎng)頁綜合排名大致由相關性和網(wǎng)頁排名乘積決定。
posted on 2008-08-09 17:43 閱讀(224) 評論(0)  編輯 收藏 引用 所屬分類: string match
青青草原综合久久大伊人导航_色综合久久天天综合_日日噜噜夜夜狠狠久久丁香五月_热久久这里只有精品
  • <ins id="pjuwb"></ins>
    <blockquote id="pjuwb"><pre id="pjuwb"></pre></blockquote>
    <noscript id="pjuwb"></noscript>
          <sup id="pjuwb"><pre id="pjuwb"></pre></sup>
            <dd id="pjuwb"></dd>
            <abbr id="pjuwb"></abbr>
            日韩一区二区久久| 国产一级一区二区| 亚洲一区二区三区高清不卡| 欧美肥婆在线| 你懂的视频欧美| 亚洲福利在线视频| 久久久久在线观看| 久久综合国产精品| 欧美国产一区二区三区激情无套| 老司机免费视频久久| 免费观看在线综合色| 欧美福利视频在线| 亚洲伦理中文字幕| 亚洲男人的天堂在线观看 | 亚洲视频久久| 在线综合欧美| 久久超碰97人人做人人爱| 久久久久高清| 亚洲精品久久久蜜桃| 亚洲一区三区视频在线观看| 久久精品亚洲一区二区三区浴池| 老司机成人在线视频| 欧美三级欧美一级| 国产真实久久| 一区二区三区国产在线观看| 久久精品99| 亚洲精品免费在线| 久久精品91久久久久久再现| 欧美精品乱码久久久久久按摩| 国产日韩精品在线观看| 亚洲另类春色国产| 久久久久久久一区二区三区| 欧美福利影院| 午夜精品久久久久久久蜜桃app| 免费日韩成人| 国产一区二区精品在线观看| 日韩午夜电影在线观看| 久久伊人免费视频| 亚洲图片激情小说| 欧美精品久久久久a| 在线看成人片| 久久久91精品国产一区二区三区| 日韩天堂在线观看| 欧美肥婆在线| 亚洲国产mv| 久久青草福利网站| 欧美亚洲一级| 国产精品日韩欧美大师| 日韩午夜电影av| 亚洲国产高潮在线观看| 久久偷窥视频| 在线观看视频一区二区| 久久精品中文字幕免费mv| 亚洲天堂av高清| 欧美三级午夜理伦三级中视频| 久久久一二三| 国产婷婷色一区二区三区在线| 亚洲一区二区网站| 日韩亚洲欧美成人| 欧美日韩爆操| 亚洲视屏在线播放| 亚洲美女av网站| 欧美精品亚洲精品| 日韩一区二区电影网| 亚洲国产精品精华液网站| 老司机一区二区| 亚洲国产精品电影| 欧美激情乱人伦| 欧美xart系列高清| 99精品欧美一区二区三区| 亚洲国产精品专区久久| 欧美另类女人| 亚洲综合色在线| 亚洲女ⅴideoshd黑人| 国产乱码精品一区二区三区五月婷 | 国产精品久久久久高潮| 亚洲伊人观看| 亚洲综合成人婷婷小说| 国产精品亚洲а∨天堂免在线| 欧美一区二区日韩一区二区| 亚洲欧洲av一区二区| 狠狠爱综合网| 亚洲国产综合视频在线观看| 欧美日韩高清在线| 亚洲欧美在线x视频| 西西裸体人体做爰大胆久久久| 国产一区二区三区高清在线观看 | 欧美色一级片| 久久精品国产亚洲高清剧情介绍| 欧美一区二区视频免费观看| 在线日韩成人| 一本一本大道香蕉久在线精品| 国产精品一级二级三级| 欧美a级片网站| 欧美午夜精品理论片a级大开眼界 欧美午夜精品理论片a级按摩 | 亚洲中字黄色| 久久激情视频| 99一区二区| 性欧美videos另类喷潮| 亚洲日本电影在线| 亚洲欧美不卡| 亚洲免费观看高清在线观看 | 黄色日韩在线| 99视频在线观看一区三区| 国产一区二区剧情av在线| 一区二区精品| 欧美资源在线| 亚洲免费在线观看| 久热精品在线| 欧美一区二区三区视频免费| 久久综合伊人| 久久av免费一区| 欧美三级电影一区| 免费成人高清在线视频| 国产精品日本| 亚洲精品免费看| 在线日韩欧美视频| 久久精彩免费视频| 久久99伊人| 欧美丝袜一区二区三区| 欧美激情第1页| 国内精品伊人久久久久av影院| 一区二区三欧美| 99国内精品久久| 欧美成人伊人久久综合网| 鲁大师影院一区二区三区| 国产精品天天摸av网| 亚洲另类春色国产| 亚洲毛片在线观看| 免费成人高清在线视频| 麻豆91精品91久久久的内涵| 国产日韩精品视频一区| 亚洲欧美日韩精品| 久久福利视频导航| 国产亚洲福利| 久久国产精品99久久久久久老狼| 午夜精品www| 国产日韩欧美三级| 欧美影院在线播放| 免费不卡在线观看av| 一色屋精品亚洲香蕉网站| 久久久91精品| 欧美国产精品人人做人人爱| 亚洲国产婷婷综合在线精品 | 欧美日韩在线高清| 亚洲人成网站在线观看播放| 亚洲人成啪啪网站| 牛人盗摄一区二区三区视频| 你懂的国产精品永久在线| 亚洲国产精品123| 欧美91视频| 亚洲人体大胆视频| 日韩视频免费观看高清完整版| 欧美激情偷拍| 一区二区日韩| 久久人体大胆视频| 亚洲国产高清在线| 欧美精品三区| 亚洲免费视频观看| 久久永久免费| 99综合在线| 国产欧美二区| 欧美va天堂| 亚洲视频一二三| 久久国产精品99国产精| 在线看日韩av| 国产精品草草| 久久久久国产精品www| 亚洲欧洲免费视频| 欧美中文字幕在线观看| 亚洲高清在线精品| 性一交一乱一区二区洋洋av| 老司机精品福利视频| 99国产一区| 黄网站免费久久| 欧美日韩视频在线一区二区观看视频 | 欧美色综合天天久久综合精品| 亚洲欧美国产精品桃花| 欧美xxxx在线观看| 亚洲一区日韩| 亚洲国产日韩欧美在线动漫| 欧美日韩专区| 久久综合久久久| 亚洲伊人久久综合| 亚洲第一精品影视| 久久精品国产一区二区三区免费看| 亚洲欧洲精品一区二区三区波多野1战4| 欧美日韩亚洲不卡| 久久久五月天| 午夜精品久久久久久久99水蜜桃| 亚洲国产成人精品女人久久久 | 亚洲欧美影音先锋| 亚洲国产一区二区在线| 久久九九精品99国产精品| 99re热精品| 亚洲欧洲日韩综合二区| 国模 一区 二区 三区| 国产精品盗摄久久久| 欧美sm视频| 免费视频一区|