肖詩伯李朝葵蘭鷹楊玉梅
(川北醫學院圖書館,四川南充637000)
[摘要]為解決讀者進入高校圖書館后面對大量圖書不能很好發現適合自身需求圖書的信息過載現象,采用大數據技術中的二分圖模型分析讀者在圖書借閱行為中的相似性,以隨機游走算法預測讀者對各圖書的不同選擇概率。通過驗證,本計算模型準確率為71%,召回率為68%,能較好預測讀者對需求圖書的行為。從而實現對讀者的個性化圖書推薦,改善讀者在圖書館中面臨的信息過載現象。
[關鍵詞]二分圖圖模型隨機游走推薦系統個性化圖書
[分類號]G250.7
1 引言
高校圖書館傳統圖書資源十分豐富,讀者進入圖書館后常因同類圖書資源太多,導致不知選擇具體某本圖書,而面臨信息過載的現象。雖然利用館藏系統檢索相關關鍵詞,相對會容易發現適合的圖書,但簡單同質的關鍵詞檢索一方面不能充分表達讀者知識需求、側重點及真實意圖;另一方面獲得的相關圖書編目信息并不能很好地發現圖書的內在知識特色和著者偏好,無法滿足不同讀者的需求。
隨著大數據分析、機器學習等相關技術的出現和發展,為解決此類問題提供了新型的技術手段。筆者運用圖模型算法,分析讀者的借閱行為特征、個人屬性,圖書資源的特征。一方面,通過讀者之間的相似行為,發現讀者的興趣,預測讀者的圖書資源需求并主動推薦給讀者[1],以幫助讀者解決進入圖書館后無法從海量圖書資源中找到適合自身需求的資源的問題。另一方面,充分發掘每本圖書的價值,而不僅僅是提供新、熱圖書,把適合的圖書推薦給適合的讀者,為解決因海量圖書出現的長尾效應(The Long Tail)問題提供幫助。
2 相關準備工作
指導思想:將讀者對圖書的借閱行為視為讀者對具體某圖書的興趣和知識需求。在多個讀者的借閱行為中,他們借閱的相同圖書越多,表明他們行為和興趣越相似,也可認為他們可能有相似的知識需求。通過對行為相似度的分析,發現讀者可能感興趣而還未借閱的圖書,然后將相關圖書主動推薦給讀者。實現以閱讀興趣為導向對讀者進行個性化圖書推薦,而非簡單的熱門或新購圖書推薦[2]。這在大數據分析手段中屬于以鄰域的方式對海量圖書協同過濾的方法。技術手段:筆者采用大數據分析技術中的二分圖模型算法來分析“讀者—圖書”之間的概率相關性。它是用頂點和邊來表示概率分布的技術。通過把各變量之間的關系獨立編碼在圖中表示,使概率分布的表達能表示成因子乘積的形式[3]。其優點是:可以更好地捕獲隨機變量間的關系。應用方法為:將讀者的借閱行為轉換為一系列無向二元組表達,單個二元組(u,i)表示讀者u 借閱過圖書i,借閱行為通過“邊”e(u,i)來連接。“讀者—圖書”二分圖模型如圖1所示。

其中un為具體讀者頂點,in為具體圖書頂點。Vu為讀者頂點集合,Vi為圖書頂點集合。e為通過借閱行為連接讀者與圖書的邊。讀者u1與i1、i3、i5相連,表示該讀者對這3本圖書產生過借閱行為。圖書i1與u1、u4相連,表示該圖書被這兩名讀者借閱過。
3 個性化推薦方法
在二分圖模型上分析讀者借閱行為,實現個性化推薦。首先將給讀者u推薦圖書的任務轉換為度量與讀者頂點u沒有“邊”連接的圖書頂點i在圖中的相關性。分析時,相關性通過計算以一種概率系數體現[4]。然后將圖書相關概率從大到小排序,相關系數越高表示讀者選擇某本圖書的可能性越大。取排序中前20本作為對讀者u 的圖書推薦列表,來實現對讀者的個性化圖書推薦。
決定讀者與圖書頂點之間相關性的因素有:①兩頂點之間“邊”的長度;②兩頂點之間“邊”的數目;③兩頂點之間的“邊”經過的頂點數。具有較高相關性的兩頂點的特征一般為:①連接兩頂點的“邊”長度較短;②連接兩頂點之間的“邊”較多;③連接兩頂點之間的“邊”沒有經過出度較大的頂點。
3.1 數據準備
把數據集按產生行為的時間分為10份,前9份作訓練集,最后1份作測試集來驗證算法對訓練集的計算準確性。運用Python模塊解析數據集,創建NumPy科學計算包和運算符模塊來調用函數。度量“圖”中兩頂點之間的相關性,采用二分圖中基于隨機游走的PersonalRank算法[5]。初始化每個頂點的初始概率值,設置某讀者un對應頂點的初始訪問概率α =1,其他頂點的初始訪問概率為0,設置“邊”的權重為1,最后調用迭代公式計算。