數據挖掘(英語:Data mining),又譯為資料探勘、數據採礦。它是數據庫知識發現(英語:Knowledge-Discovery in Databases,簡稱:KDD)中的一個步驟。數據挖掘一般是指從大量的數據中通過算法搜索隱藏於其中信息的過程。數據挖掘通常與計算機科學有關,並通過統計、在線分析處理、情報檢索、機器學習、專家系統(依靠過去的經驗法則)和模式識別等諸多方法來實現上述目標。
首先從數據中選出已經分好類的訓練集,在該訓練集上運用數據挖掘分類的技術,建立分類模型,對於沒有分類的數據進行分類。 例子: a. 信用卡申請者,分類為低、中、高風險 b. 分配客戶到預先定義的客戶分片 注意: 類的個數是確定的,預先定義好的
· 估值(Estimation)
估值與分類類似,不同之處在於,分類描述的是離散型變量的輸出,而估值處理連續值的輸出;分類的類別是確定數目的,估值的量是不確定的。 例子: a. 根據購買模式,估計一個家庭的孩子個數 b. 根據購買模式,估計一個家庭的收入 c. 估計real estate的價值 一般來說,估值可以作為分類的前一步工作。給定一些輸入數據,通過估值,得到未知的連續變量的值,然後,根據預先設定的閾值,進行分類。例如:銀行對家庭貸款業務,運用估值,給各個客戶記分(Score 0~1)。然後,根據閾值,將貸款級別分類。
· 相關性分組或關聯規則(Affinity grouping or association rules)
決定哪些事情將一起發生。 例子: a. 超市中客戶在購買A的同時,經常會購買B,即A => B(關聯規則) b. 客戶在購買A後,隔一段時間,會購買B (序列分析)
· 聚集(Clustering)
聚集是對記錄分組,把相似的記錄在一個聚集裡。聚集和分類的區別是聚集不依賴於預先定義好的類,不需要訓練集。 例子: a. 一些特定症狀的聚集可能預示了一個特定的疾病 b. 租VCD類型不相似的客戶聚集,可能暗示成員屬於不同的亞文化群 聚集通常作為數據挖掘的第一步。例如,"哪一種類的促銷對客戶響應最好?",對於這一 類問題,首先對整個客戶做聚集,將客戶分組在各自的聚集裡,然後對每個不同的聚集,回答問題,可能效果更好。
· 描述和可視化(Des cription and Visualization) 是對數據挖掘結果的表示方式。