pythonde 樸素貝葉斯演算法-Python教學-PHP中文網

首頁

後端開發

Python教學

pythonde 樸素貝葉斯演算法

巴扎黑

Sep 04, 2017 pm 01:41 PM

演算法

演算法優缺點

優點：在資料較少的情況下仍然有效，可以處理多類別問題

缺點：對輸入資料的準備方式敏感

#適用資料型態：標稱型資料

演算法想法：

樸素貝葉斯

例如我們想判斷一個郵件是不是垃圾郵件，那麼我們知道的是這個郵件中的字的分佈，那我們還要知道：垃圾郵件中某些字的出現是多少，就可以利用貝葉斯定理得到。

樸素貝葉斯分類器中的一個假設是：每個特徵同等重要

貝葉斯分類是一類分類演算法的總稱，這類演算法均以貝葉斯定理為基礎，故統稱為貝葉斯分類。

函數

loadDataSet()

建立資料集，這裡的資料集是已經拆分好的單字組成的句子，表示的是某論壇的使用者評論，標籤1表示這個是罵人的

createVocabList(dataSet)

找出這些句子中總共有多少單字，以決定我們詞向量的大小

setOfWords2Vec(vocabList, inputSet)

將句子根據其中的單字轉成向量，這裡用的是伯努利模型，也就是只考慮這個單字是否存在

bagOfWords2VecMN(vocabList, inputSet)

#這個是另一個句子轉成向量的模型，多項式模型，考慮某個字的出現次數

trainNB0(trainMatrix,trainCatergory)

計算P(i)和P (w[i]|C[1])和P(w[i]|C[0])，這裡有兩個技巧，一個是開始的分子分母沒有全部初始化為0是為了防止其中一個的機率為0導致整體為0，另一個是後面乘用對數防止因為精確度問題結果為0

classifyNB(vec2Classify, p0Vec, p1Vec, pClass1)

根據貝葉斯公式計算這個向量屬於兩個集合中哪一個的機率高

#coding=utf-8
from numpy import *
def loadDataSet():
    postingList=[[&#39;my&#39;, &#39;dog&#39;, &#39;has&#39;, &#39;flea&#39;, &#39;problems&#39;, &#39;help&#39;, &#39;please&#39;],
                 [&#39;maybe&#39;, &#39;not&#39;, &#39;take&#39;, &#39;him&#39;, &#39;to&#39;, &#39;dog&#39;, &#39;park&#39;, &#39;stupid&#39;],
                 [&#39;my&#39;, &#39;dalmation&#39;, &#39;is&#39;, &#39;so&#39;, &#39;cute&#39;, &#39;I&#39;, &#39;love&#39;, &#39;him&#39;],
                 [&#39;stop&#39;, &#39;posting&#39;, &#39;stupid&#39;, &#39;worthless&#39;, &#39;garbage&#39;],
                 [&#39;mr&#39;, &#39;licks&#39;, &#39;ate&#39;, &#39;my&#39;, &#39;steak&#39;, &#39;how&#39;, &#39;to&#39;, &#39;stop&#39;, &#39;him&#39;],
                 [&#39;quit&#39;, &#39;buying&#39;, &#39;worthless&#39;, &#39;dog&#39;, &#39;food&#39;, &#39;stupid&#39;]]
    classVec = [0,1,0,1,0,1]    #1 is abusive, 0 not
    return postingList,classVec
#创建一个带有所有单词的列表
def createVocabList(dataSet):
    vocabSet = set([])
    for document in dataSet:
        vocabSet = vocabSet | set(document)
    return list(vocabSet)
    
def setOfWords2Vec(vocabList, inputSet):
    retVocabList = [0] * len(vocabList)
    for word in inputSet:
        if word in vocabList:
            retVocabList[vocabList.index(word)] = 1
        else:
            print &#39;word &#39;,word ,&#39;not in dict&#39;
    return retVocabList
#另一种模型    
def bagOfWords2VecMN(vocabList, inputSet):
    returnVec = [0]*len(vocabList)
    for word in inputSet:
        if word in vocabList:
            returnVec[vocabList.index(word)] += 1
    return returnVec
def trainNB0(trainMatrix,trainCatergory):
    numTrainDoc = len(trainMatrix)
    numWords = len(trainMatrix[0])
    pAbusive = sum(trainCatergory)/float(numTrainDoc)
    #防止多个概率的成绩当中的一个为0
    p0Num = ones(numWords)
    p1Num = ones(numWords)
    p0Denom = 2.0
    p1Denom = 2.0
    for i in range(numTrainDoc):
        if trainCatergory[i] == 1:
            p1Num +=trainMatrix[i]
            p1Denom += sum(trainMatrix[i])
        else:
            p0Num +=trainMatrix[i]
            p0Denom += sum(trainMatrix[i])
    p1Vect = log(p1Num/p1Denom)#处于精度的考虑，否则很可能到限归零
    p0Vect = log(p0Num/p0Denom)
    return p0Vect,p1Vect,pAbusive
    
def classifyNB(vec2Classify, p0Vec, p1Vec, pClass1):
    p1 = sum(vec2Classify * p1Vec) + log(pClass1)    #element-wise mult
    p0 = sum(vec2Classify * p0Vec) + log(1.0 - pClass1)
    if p1 > p0:
        return 1
    else: 
        return 0
        
def testingNB():
    listOPosts,listClasses = loadDataSet()
    myVocabList = createVocabList(listOPosts)
    trainMat=[]
    for postinDoc in listOPosts:
        trainMat.append(setOfWords2Vec(myVocabList, postinDoc))
    p0V,p1V,pAb = trainNB0(array(trainMat),array(listClasses))
    testEntry = [&#39;love&#39;, &#39;my&#39;, &#39;dalmation&#39;]
    thisDoc = array(setOfWords2Vec(myVocabList, testEntry))
    print testEntry,&#39;classified as: &#39;,classifyNB(thisDoc,p0V,p1V,pAb)
    testEntry = [&#39;stupid&#39;, &#39;garbage&#39;]
    thisDoc = array(setOfWords2Vec(myVocabList, testEntry))
    print testEntry,&#39;classified as: &#39;,classifyNB(thisDoc,p0V,p1V,pAb)
    
    
def main():
    testingNB()
    
if __name__ == &#39;__main__&#39;:
    main()

登入後複製

以上是pythonde 樸素貝葉斯演算法的詳細內容。更多資訊請關注PHP中文網其他相關文章！

本網站聲明

本文內容由網友自願投稿，版權歸原作者所有。本站不承擔相應的法律責任。如發現涉嫌抄襲或侵權的內容，請聯絡admin@php.cn

熱AI工具

熱工具

熱門話題

gmail信箱登陸入口在哪裡

7852

Java教學

1649

CakePHP 教程

1403

Laravel 教程

1300

PHP教程

1241

Related knowledge

CLIP-BEVFormer：明確監督BEVFormer結構，提升長尾偵測性能 Mar 26, 2024 pm 12:41 PM

寫在前面&筆者的個人理解目前，在整個自動駕駛系統當中，感知模組扮演了其中至關重要的角色，行駛在道路上的自動駕駛車輛只有通過感知模組獲得到準確的感知結果後，才能讓自動駕駛系統中的下游規控模組做出及時、正確的判斷和行為決策。目前，具備自動駕駛功能的汽車中通常會配備包括環視相機感測器、光達感測器以及毫米波雷達感測器在內的多種數據資訊感測器來收集不同模態的信息，用於實現準確的感知任務。基於純視覺的BEV感知演算法因其較低的硬體成本和易於部署的特點，以及其輸出結果能便捷地應用於各種下游任務，因此受到工業

使用C++實現機器學習演算法：常見挑戰及解決方案 Jun 03, 2024 pm 01:25 PM

C++中機器學習演算法面臨的常見挑戰包括記憶體管理、多執行緒、效能最佳化和可維護性。解決方案包括使用智慧指標、現代線程庫、SIMD指令和第三方庫，並遵循程式碼風格指南和使用自動化工具。實作案例展示如何利用Eigen函式庫實現線性迴歸演算法，有效地管理記憶體和使用高效能矩陣操作。

探究C++sort函數的底層原理與演算法選擇 Apr 02, 2024 pm 05:36 PM

C++sort函數底層採用歸併排序，其複雜度為O(nlogn)，並提供不同的排序演算法選擇，包括快速排序、堆排序和穩定排序。

人工智慧可以預測犯罪嗎？探索CrimeGPT的能力 Mar 22, 2024 pm 10:10 PM

人工智慧(AI)與執法領域的融合為犯罪預防和偵查開啟了新的可能性。人工智慧的預測能力被廣泛應用於CrimeGPT(犯罪預測技術)等系統，用於預測犯罪活動。本文探討了人工智慧在犯罪預測領域的潛力、目前的應用情況、所面臨的挑戰以及相關技術可能帶來的道德影響。人工智慧和犯罪預測：基礎知識CrimeGPT利用機器學習演算法來分析大量資料集，識別可以預測犯罪可能發生的地點和時間的模式。這些資料集包括歷史犯罪統計資料、人口統計資料、經濟指標、天氣模式等。透過識別人類分析師可能忽視的趨勢，人工智慧可以為執法機構

改進的檢測演算法：用於高解析度光學遙感影像目標檢測 Jun 06, 2024 pm 12:33 PM

01前景概要目前，難以在檢測效率和檢測結果之間取得適當的平衡。我們研究了一種用於高解析度光學遙感影像中目標偵測的增強YOLOv5演算法，利用多層特徵金字塔、多重偵測頭策略和混合注意力模組來提高光學遙感影像的目標偵測網路的效果。根據SIMD資料集，新演算法的mAP比YOLOv5好2.2%，比YOLOX好8.48%，在偵測結果和速度之間達到了更好的平衡。 02背景&動機隨著遠感技術的快速發展，高解析度光學遠感影像已被用於描述地球表面的許多物體，包括飛機、汽車、建築物等。目標檢測在遠感影像的解釋中

九章雲極DataCanvas多模態大模型平台的實踐與思考 Oct 20, 2023 am 08:45 AM

一、多模態大模型的歷史發展上圖這張照片是1956年在美國達特茅斯學院舉行的第一屆人工智慧workshop，這次會議也被認為拉開了人工智慧的序幕，與會者主要是符號邏輯學屆的前驅（除了前排中間的神經生物學家PeterMilner）。然而這套符號邏輯學理論在隨後的很長一段時間內都無法實現，甚至到80年代90年代還迎來了第一次AI寒冬期。直到最近大語言模型的落地，我們才發現真正承載這個邏輯思維的是神經網絡，神經生物學家PeterMilner的工作激發了後來人工神經網絡的發展，也正因為此他被邀請參加了這個

演算法在 58 畫像平台建置中的應用 May 09, 2024 am 09:01 AM

一、58畫像平台建置背景首先和大家分享下58畫像平台的建造背景。 1.傳統的畫像平台傳統的想法已經不夠，建立用戶畫像平台依賴數據倉儲建模能力，整合多業務線數據，建構準確的用戶畫像；還需要數據挖掘，理解用戶行為、興趣和需求，提供演算法側的能力；最後，還需要具備數據平台能力，有效率地儲存、查詢和共享用戶畫像數據，提供畫像服務。業務自建畫像平台和中台類型畫像平台主要區別在於，業務自建畫像平台服務單條業務線，按需定制；中台平台服務多條業務線，建模複雜，提供更為通用的能力。 2.58中台畫像建構的背景58的使用者畫像

即時加SOTA一飛沖天！ FastOcc：推理更快、部署友善Occ演算法來啦！ Mar 14, 2024 pm 11:50 PM

寫在前面&筆者的個人理解在自動駕駛系統當中，感知任務是整個自駕系統中至關重要的組成部分。感知任務的主要目標是使自動駕駛車輛能夠理解和感知周圍的環境元素，如行駛在路上的車輛、路旁的行人、行駛過程中遇到的障礙物、路上的交通標誌等，從而幫助下游模組做出正確合理的決策和行為。在一輛具備自動駕駛功能的車輛中，通常會配備不同類型的信息採集感測器，如環視相機感測器、雷射雷達感測器以及毫米波雷達感測器等等，從而確保自動駕駛車輛能夠準確感知和理解周圍環境要素，使自動駕駛車輛在自主行駛的過程中能夠做出正確的決斷。目

See all articles

pythonde 樸素貝葉斯演算法

熱AI工具

Undresser.AI Undress

AI Clothes Remover

Undress AI Tool

Clothoff.io

Video Face Swap

熱門文章

熱工具

記事本++7.3.1

SublimeText3漢化版

禪工作室 13.0.1

Dreamweaver CS6

SublimeText3 Mac版

熱門話題