SimRank for 協同過濾

概覽

  • 使用場景
  • 直觀解釋
  • 計算 & 拓展
  • 舉個栗子(python)
  • 算法復雜度

最后真推薦歌了~

使用場景

想象一個做協同過濾的推薦場景,想象不出來看下圖~

user-item graph

先試試傳統的基于物品的協同過濾(cf)方法,用戶1喜歡搖滾和輕音樂,簡單認為搖滾和輕音樂是相似的。同理用戶2喜歡輕音樂和民謠,簡單認為輕音樂和民謠相似。

最后計算item間相似度的時候,和搖滾相似的是輕音樂,和民謠相似的是輕音樂,傳統的基于item的cf是發現不了搖滾和民謠的相似性的。

這里就不考慮基于用戶的cf了,確實基于用戶的cf是可以發現搖滾和民謠的關系滴~

這里帶入SimRank的思想

Two objects are similar if they are related to similar objects.

這里物品的關系由消費物品的用戶來表達。

image.png

從用戶1和用戶2的歷史記錄里面得到的 搖滾 - 輕音樂 - 民謠 的關系,可以得到搖滾和民謠的相似度

說明 SimRank 的思想可以發現 ItemCF 發現不了的 item 相似關系

直觀解釋

定義與公式

item-item關系圖

item-item關系圖

節點a關聯到節點b的關系

節點a關聯到節點b的關系

節點a的鄰居節點集合,即所有指向a的節點集合

節點a的鄰居節點集合

節點間相似度s(a,b),C是衰減因子,經驗取值為0.8

節點間相似度s(a,b)

復現計算過程

6個用戶收聽5首歌的情景,通過log生成左邊的二部圖,再通過用戶作為聯系生成右邊的item關系圖

image.png

按照相似度公式依次計算每個節點,發現I2和I4有共同的入度節點I1,就是從(I1,I1)發現了(I2,I4)

image.png

依次進行n輪計算,圖中標明了每輪計算新發現的關系,每次新發現的關系又可以反補給以前發現的關系,作為增強

image.png

可以發現第一輪發現的關系類似于推薦理由“喜歡x的用戶也喜歡y”,這種第一輪計算發現的關系可以看作item之間的一次跳躍,暫時稱作一跳關系,第二輪迭代發現的(I3,I5)可以看做是2條關系,第n輪拓展的為n跳關系

基于MR模型的計算方法

map階段

去尋找每個節點的相鄰節點,即尋找I(a)里,I(b)里所有點的相似度,從而計算s(a,b)

reduce階段

根據計算結果更新全局的相似度

image.png

拓展的simrank

打開方法:自行google

  1. delta-simrank
  2. simrank++

計算方式的拓展

  1. 深度優先搜索
  1. 基于矩陣乘法的計算

python的local Example


G = nx.read_graphml("/Users/Matter/paper_code/simrank/widom.graphml")
r=0.8
max_iter=10
eps=1e-4
nodes = G.nodes()   #['1', '0', '3', '2', '4']

pred_func = G.predecessors if isinstance(G, nx.DiGraph) else G.neighbors
#  nodes_i      {'0': 1, '1': 0, '2': 3, '3': 2, '4': 4}
nodes_i = {nodes[i]: i for i in range(0, len(nodes))}

sim_prev = numpy.zeros(len(nodes))  # array([ 0.,  0.,  0.,  0.,  0.])
sim = numpy.identity(len(nodes))
# ###  單位矩陣
# array([[ 1.,  0.,  0.,  0.,  0.],
#        [ 0.,  1.,  0.,  0.,  0.],
#        [ 0.,  0.,  1.,  0.,  0.],
#        [ 0.,  0.,  0.,  1.,  0.],
#        [ 0.,  0.,  0.,  0.,  1.]])
# ###

# round 1
sim_prev = numpy.copy(sim)

for u, v in itertools.product(nodes, nodes):
    if u==v:continue
    u_ps, v_ps = pred_func(u), pred_func(v)
    s_uv = 0
    for u_n, v_n in itertools.product(u_ps, v_ps):
        s_uv += sim_prev[nodes_i[u_n]][nodes_i[v_n]]
    sim[nodes_i[u]][nodes_i[v]] = (r * s_uv) / (len(u_ps) * len(v_ps) + DIV_EPS)

對應圖的結構

<?xml version="1.0" encoding="utf-8"?><graphml xmlns="[http://graphml.graphdrawing.org/xmlns](http://graphml.graphdrawing.org/xmlns)" xmlns:xsi="[http://www.w3.org/2001/XMLSchema-instance](http://www.w3.org/2001/XMLSchema-instance)" xsi:schemaLocation="[http://graphml.graphdrawing.org/xmlns](http://graphml.graphdrawing.org/xmlns) [http://graphml.graphdrawing.org/xmlns/1.0/graphml.xsd](http://graphml.graphdrawing.org/xmlns/1.0/graphml.xsd)">
  <graph edgedefault="directed">
    <node id="0" />
    <node id="1" />
    <node id="2" />
    <node id="3" />
    <node id="4" />
    <edge source="0" target="1" />
    <edge source="2" target="0" />
    <edge source="1" target="2" />
    <edge source="0" target="3" />
    <edge source="3" target="4" />
    <edge source="4" target="3" />
  </graph>
</graphml>

算法復雜度

n_i:item的數量
n:item對的數量,大概是n_i * n_i
neighbor:每個item的平均鄰居數量
d:每一對vid對里的結點鄰居平均數量乘積,大概 neighbor * neighbor
一輪迭代的空間復雜度:O(n*n)
一輪迭代的空間復雜度:O(n*n*d)

對應到item數量就是O(n_i * n_i * n_i * n_i)的復雜度
簡而言之就是item做笛卡爾得到item pair,再對item pair做笛卡爾

后記

最后編輯于
?著作權歸作者所有,轉載或內容合作請聯系作者
平臺聲明:文章內容(如有圖片或視頻亦包括在內)由作者上傳并發布,文章內容僅代表作者本人觀點,簡書系信息發布平臺,僅提供信息存儲服務。
  • 序言:七十年代末,一起剝皮案震驚了整個濱河市,隨后出現的幾起案子,更是在濱河造成了極大的恐慌,老刑警劉巖,帶你破解...
    沈念sama閱讀 229,565評論 6 539
  • 序言:濱河連續發生了三起死亡事件,死亡現場離奇詭異,居然都是意外死亡,警方通過查閱死者的電腦和手機,發現死者居然都...
    沈念sama閱讀 99,115評論 3 423
  • 文/潘曉璐 我一進店門,熙熙樓的掌柜王于貴愁眉苦臉地迎上來,“玉大人,你說我怎么就攤上這事。” “怎么了?”我有些...
    開封第一講書人閱讀 177,577評論 0 382
  • 文/不壞的土叔 我叫張陵,是天一觀的道長。 經常有香客問我,道長,這世上最難降的妖魔是什么? 我笑而不...
    開封第一講書人閱讀 63,514評論 1 316
  • 正文 為了忘掉前任,我火速辦了婚禮,結果婚禮上,老公的妹妹穿的比我還像新娘。我一直安慰自己,他們只是感情好,可當我...
    茶點故事閱讀 72,234評論 6 410
  • 文/花漫 我一把揭開白布。 她就那樣靜靜地躺著,像睡著了一般。 火紅的嫁衣襯著肌膚如雪。 梳的紋絲不亂的頭發上,一...
    開封第一講書人閱讀 55,621評論 1 326
  • 那天,我揣著相機與錄音,去河邊找鬼。 笑死,一個胖子當著我的面吹牛,可吹牛的內容都是我干的。 我是一名探鬼主播,決...
    沈念sama閱讀 43,641評論 3 444
  • 文/蒼蘭香墨 我猛地睜開眼,長吁一口氣:“原來是場噩夢啊……” “哼!你這毒婦竟也來了?” 一聲冷哼從身側響起,我...
    開封第一講書人閱讀 42,822評論 0 289
  • 序言:老撾萬榮一對情侶失蹤,失蹤者是張志新(化名)和其女友劉穎,沒想到半個月后,有當地人在樹林里發現了一具尸體,經...
    沈念sama閱讀 49,380評論 1 335
  • 正文 獨居荒郊野嶺守林人離奇死亡,尸身上長有42處帶血的膿包…… 初始之章·張勛 以下內容為張勛視角 年9月15日...
    茶點故事閱讀 41,128評論 3 356
  • 正文 我和宋清朗相戀三年,在試婚紗的時候發現自己被綠了。 大學時的朋友給我發了我未婚夫和他白月光在一起吃飯的照片。...
    茶點故事閱讀 43,319評論 1 371
  • 序言:一個原本活蹦亂跳的男人離奇死亡,死狀恐怖,靈堂內的尸體忽然破棺而出,到底是詐尸還是另有隱情,我是刑警寧澤,帶...
    沈念sama閱讀 38,879評論 5 362
  • 正文 年R本政府宣布,位于F島的核電站,受9級特大地震影響,放射性物質發生泄漏。R本人自食惡果不足惜,卻給世界環境...
    茶點故事閱讀 44,548評論 3 348
  • 文/蒙蒙 一、第九天 我趴在偏房一處隱蔽的房頂上張望。 院中可真熱鬧,春花似錦、人聲如沸。這莊子的主人今日做“春日...
    開封第一講書人閱讀 34,970評論 0 28
  • 文/蒼蘭香墨 我抬頭看了看天上的太陽。三九已至,卻和暖如春,著一層夾襖步出監牢的瞬間,已是汗流浹背。 一陣腳步聲響...
    開封第一講書人閱讀 36,229評論 1 291
  • 我被黑心中介騙來泰國打工, 沒想到剛下飛機就差點兒被人妖公主榨干…… 1. 我叫王不留,地道東北人。 一個月前我還...
    沈念sama閱讀 52,048評論 3 397
  • 正文 我出身青樓,卻偏偏與公主長得像,于是被迫代替她去往敵國和親。 傳聞我的和親對象是個殘疾皇子,可洞房花燭夜當晚...
    茶點故事閱讀 48,285評論 2 376

推薦閱讀更多精彩內容