php+mysql 협업 필터링 알고리즘 구현-PHP 튜토리얼-php.cn

집

백엔드 개발

PHP 튜토리얼

php+mysql 협업 필터링 알고리즘 구현

巴扎黑

Aug 15, 2017 am 09:29 AM

php php+mysql 성취하다

협업 필터링 추천 알고리즘을 구현하려면 먼저 알고리즘의 핵심 아이디어와 프로세스를 이해해야 합니다. 이 알고리즘의 핵심 아이디어는 다음과 같이 요약할 수 있습니다. a와 b가 동일한 일련의 항목을 좋아한다면(지금은 b를 이웃이라고 부르겠습니다), a는 b가 좋아하는 다른 항목을 좋아할 가능성이 높습니다. 알고리즘의 구현 과정은 다음과 같이 간단하게 요약할 수 있습니다. 1. a가 어떤 이웃을 가지고 있는지 결정합니다. 2. 이웃을 사용하여 a가 어떤 종류의 항목을 좋아할지 예측합니다. 3. a가 a에게 좋아할 만한 항목을 추천합니다.

알고리즘의 핵심 공식은 다음과 같습니다.

1. 코사인 유사성(이웃 찾기):

php+mysql 협업 필터링 알고리즘 구현

2. 예측 공식(어떤 종류의 항목을 좋아할지 예측):

php+mysql 협업 필터링 알고리즘 구현

만 이 두 공식에서 우리는 이 두 공식에 따라 계산하는 것만으로도 많은 루프와 판단이 필요하며 정렬 알고리즘의 선택과 사용과 관련된 정렬 문제도 포함된다는 것을 알 수 있습니다. 인터넷에서 퀵큐를 복사해서 바로 사용했어요. 한마디로 빅데이터의 경우 효율성은 말할 것도 없고 구현하기도 매우 번거롭다.

먼저 테이블 만들기:

DROP TABLE IF EXISTS `tb_xttj`;
CREATE TABLE `tb_xttj` (
  `name` varchar(255) NOT NULL,
  `a` int(255) default NULL,
  `b` int(255) default NULL,
  `c` int(255) default NULL,
  `d` int(255) default NULL,
  `e` int(255) default NULL,
  `f` int(255) default NULL,
  `g` int(255) default NULL,
  `h` int(255) default NULL,
  PRIMARY KEY  (`name`)
) ENGINE=MyISAM DEFAULT CHARSET=latin1;

INSERT INTO `tb_xttj` VALUES (&#39;John&#39;, &#39;4&#39;, &#39;4&#39;, &#39;5&#39;, &#39;4&#39;, &#39;3&#39;, &#39;2&#39;, &#39;1&#39;, null);
INSERT INTO `tb_xttj` VALUES (&#39;Mary&#39;, &#39;3&#39;, &#39;4&#39;, &#39;4&#39;, &#39;2&#39;, &#39;5&#39;, &#39;4&#39;, &#39;3&#39;, null);
INSERT INTO `tb_xttj` VALUES (&#39;Lucy&#39;, &#39;2&#39;, &#39;3&#39;, null, &#39;3&#39;, null, &#39;3&#39;, &#39;4&#39;, &#39;5&#39;);
INSERT INTO `tb_xttj` VALUES (&#39;Tom&#39;, &#39;3&#39;, &#39;4&#39;, &#39;5&#39;, null, &#39;1&#39;, &#39;3&#39;, &#39;5&#39;, &#39;4&#39;);
INSERT INTO `tb_xttj` VALUES (&#39;Bill&#39;, &#39;3&#39;, &#39;2&#39;, &#39;1&#39;, &#39;5&#39;, &#39;3&#39;, &#39;2&#39;, &#39;1&#39;, &#39;1&#39;);
INSERT INTO `tb_xttj` VALUES (&#39;Leo&#39;, &#39;3&#39;, &#39;4&#39;, &#39;5&#39;, &#39;2&#39;, &#39;4&#39;, null, null, null);

로그인 후 복사

f, g, h 중 어떤 것을 추천할 수 있는지 마지막 행의 Leo만 추천하겠습니다.

php+mysql을 사용했을 때의 흐름도는 다음과 같습니다.

데이터베이스에 연결하여 2차원 배열로 저장하는 코드는 다음과 같습니다:

header("Content-Type:text/html;charset=utf-8");

mysql_connect("localhost","root","admin");
mysql_select_db("geodatabase");
mysql_query("set names &#39;utf8&#39;");	

$sql = "SELECT * FROM tb_xttj";
$result = mysql_query($sql);

$array = array();
while($row=mysql_fetch_array($result))
{
	$array[]=$row;//$array[][]是一个二维数组
}

로그인 후 복사

질문 1: 이 단계는 전체 테이블 쿼리로 간주될 수 있으며 이러한 종류의 쿼리는 금기시됩니다. 이 소규모 데모 시스템에서는 괜찮지만 빅 데이터 시스템에서는 비효율적입니다. 개선 방법은 아직 더 배워야 합니다.

레오 등의 Cos 값을 구하는 코드는 다음과 같습니다.

/*
 * 以下示例只求Leo的推荐,如此给变量命名我也是醉了;初次理解算法，先不考虑效率和逻辑的问题，主要把过程做出来
 */

$cos = array();
$cos[0] = 0;
$fm1 = 0;
//开始计算cos
//计算分母1，分母1是第一个公式里面 “*”号左边的内容，分母二是右边的内容
for($i=1;$i<9;$i++){
	if($array[5][$i] != null){//$array[5]代表Leo
		$fm1 += $array[5][$i] * $array[5][$i];
	}
}

$fm1 = sqrt($fm1);

for($i=0;$i<5;$i++){
	$fz = 0;
	$fm2 = 0;
	echo "Cos(".$array[5][0].",".$array[$i][0].")=";
	
	for($j=1;$j<9;$j++){
	    //计算分子
		if($array[5][$j] != null && $array[$i][$j] != null){
			$fz += $array[5][$j] * $array[$i][$j];
		}
		//计算分母2
		if($array[$i][$j] != null){
			$fm2 += $array[$i][$j] * $array[$i][$j];
		}			
	}
	$fm2 = sqrt($fm2);
	$cos[$i] = $fz/$fm1/$fm2;
	echo $cos[$i]."<br/>";
}

로그인 후 복사

이 단계의 결과는 Jiang Zi입니다.

구한 Cos 값을 정렬하고 다음과 같이 퀵 정렬 코드를 사용합니다(복사) from Baidu):

//对计算结果进行排序,凑合用快排吧先
function quicksort($str){
	if(count($str)<=1) return $str;//如果个数不大于一，直接返回
	$key=$str[0];//取一个值，稍后用来比较；
	$left_arr=array();
	$right_arr=array();
	
	for($i=1;$i<count($str);$i++){//比$key大的放在右边，小的放在左边；
		if($str[$i]>=$key)
		$left_arr[]=$str[$i];
		else
		$right_arr[]=$str[$i];
	}
	$left_arr=quicksort($left_arr);//进行递归；
	$right_arr=quicksort($right_arr);
	return array_merge($left_arr,array($key),$right_arr);//将左中右的值合并成一个数组；
}

$neighbour = array();//$neighbour只是对cos值进行排序并存储
$neighbour = quicksort($cos);

로그인 후 복사

여기의 $neighbour 배열은 Cos 값을 큰 것에서 작은 것으로 정렬한 것만 저장하며 사람과 연결되지 않습니다. 이 문제는 여전히 해결되어야 합니다.

CoS 값이 가장 높은 3명을 레오의 이웃으로 선택하세요:

//$neighbour_set 存储最近邻的人和cos值
$neighbour_set = array();
for($i=0;$i<3;$i++){
	for($j=0;$j<5;$j++){
		if($neighbour[$i] == $cos[$j]){
			$neighbour_set[$i][0] = $j;
			$neighbour_set[$i][1] = $cos[$j];
			$neighbour_set[$i][2] = $array[$j][6];//邻居对f的评分
			$neighbour_set[$i][3] = $array[$j][7];//邻居对g的评分
			$neighbour_set[$i][4] = $array[$j][8];//邻居对h的评分
		}
	}
}
print_r($neighbour_set);
echo "<p><br/>";

로그인 후 복사

이 단계의 결과는 Jiang Zi입니다:

이것은 2차원 배열이며, 배열의 첫 번째 수준은 0, 1, 2이며 3명을 나타냅니다. 두 번째 수준 첨자 0은 데이터 테이블의 이웃 순서를 나타냅니다. 예를 들어 Jhon은 테이블의 0번째 사람이고, 첨자 1은 Leo와 이웃 2, 3, 4의 Cos 값을 나타냅니다. 이웃 쌍 f 와 g , h 등급을 각각 나타냅니다.

예측을 시작합니다. Predict의 계산 코드는 다음과 같습니다.

Leo의 f, g, h에 대한 예측값을 각각 계산합니다. 여기에는 문제가 있습니다. 즉, 일부 이웃에 f, g, h에 대한 빈 점수가 있는 경우 이를 처리하는 방법입니다. 예를 들어, h에 대한 Jhon과 Mary의 평가는 비어 있습니다. 본능적으로 if를 사용하여 판단하고, 비어 있으면 이 일련의 계산을 건너뛰는 것을 생각하지만 이것이 합리적인지 여부는 여전히 고려되어야 합니다. 다음 코드는 if 판단을 작성하지 않습니다.

//计算Leo对f的评分
$p_arr = array();
$pfz_f = 0;
$pfm_f = 0;
for($i=0;$i<3;$i++){
	$pfz_f += $neighbour_set[$i][1] * $neighbour_set[$i][2];
	$pfm_f += $neighbour_set[$i][1];
}
$p_arr[0][0] = 6;
$p_arr[0][1] = $pfz_f/sqrt($pfm_f);
if($p_arr[0][1]>3){
	echo "推荐f";
}

//计算Leo对g的评分
$pfz_g = 0;
$pfm_g = 0;
for($i=0;$i<3;$i++){
	$pfz_g += $neighbour_set[$i][1] * $neighbour_set[$i][3];
	$pfm_g += $neighbour_set[$i][1];
	$p_arr[1][0] = 7;
	$p_arr[1][1] = $pfz_g/sqrt($pfm_g);
}
if($p_arr[0][1]>3){
	echo "推荐g";
}

//计算Leo对h的评分
$pfz_h = 0;
$pfm_h = 0;
for($i=0;$i<3;$i++){
	$pfz_h += $neighbour_set[$i][1] * $neighbour_set[$i][4];
	$pfm_h += $neighbour_set[$i][1];
	$p_arr[2][0] = 8;
	$p_arr[2][1] = $pfz_h/sqrt($pfm_h);
}
print_r($p_arr);
if($p_arr[0][1]>3){
	echo "推荐h";
}

로그인 후 복사

$p_arr는 Leo에 권장되는 배열이며, 그 내용은 다음과 유사합니다.

Array ( [0] => Array ( [0] => 6 [1] => 4.2314002228795 ) [1 ] => ; 배열 ( [0] => 7 [1] => 2.6511380196197 ) [2] => 배열 ( [0] => 8 [1] => 0.45287424581774 ) )

f는 첫 번째 6입니다. 열, Predict 값은 4.23, g는 일곱 번째 열, Predict 값은 2.65...

f, g, h의 Predict 값을 계산한 후 두 가지 처리 방법이 있습니다. 하나는 Predict를 사용하는 것입니다. value 3보다 큰 항목을 레오에게 추천하는 방법 또 다른 방법은 Predict 값을 큰 것부터 작은 것 순으로 정렬한 후 Predict 값이 큰 상위 2개 항목을 레오에게 추천하는 것입니다. 이 코드는 작성되지 않았습니다.

위의 예에서 볼 수 있듯이 추천 알고리즘의 구현은 루핑, 판단, 배열 병합 등이 필요하여 매우 번거롭습니다. 제대로 처리하지 않으면 시스템에 부담이 됩니다. 실제 처리에는 여전히 다음과 같은 문제가 있습니다.

1. 위의 예에서는 Leo만 추천했으며 Leo는 항목 f, g, h를 평가하지 않았다는 것을 이미 알고 있습니다. 실제 시스템에 적용하면 추천이 필요한 각 사용자에 대해 어떤 항목을 평가하지 않았는지 알아내야 하는데, 이는 또 다른 오버헤드 부분입니다.

2. 실제 시스템에서는 전체 테이블 쿼리를 수행해서는 안 됩니다. 예를 들어 표에서 Leo와 다른 사람들 사이의 Cos 값을 찾습니다. 값이 0.80보다 크면 이웃이 될 수 있다는 의미입니다. 이런 식으로 10개의 이웃을 찾으면 전체 테이블에 대한 쿼리를 피하기 위해 Cos 값 계산을 중단합니다. 이 방법은 추천 항목에도 적절하게 사용할 수 있습니다. 예를 들어 10개 항목만 추천하고 추천 후 예측 값 계산을 중지합니다.

3. 시스템을 사용하면 항목도 변경됩니다. 오늘은 fgh이고 내일은 xyz일 수 있습니다. 데이터 테이블은 동적으로 변경되어야 합니다.

4. 콘텐츠 기반 추천을 적절하게 도입하여 추천 알고리즘을 개선할 수 있습니다.

5. 권장되는 정확도 문제는 다른 표준 값을 설정하면 정확도에 영향을 미칩니다.

요약: 본질적인 문제는 알고리즘의 효율성이 높지 않다는 점이라고 생각합니다. 더 나은 협업 필터링 추천 알고리즘이 있는지 계속해서 연구해 보세요.

위 내용은 php+mysql 협업 필터링 알고리즘 구현의 상세 내용입니다. 자세한 내용은 PHP 중국어 웹사이트의 기타 관련 기사를 참조하세요!

본 웹사이트의 성명

본 글의 내용은 네티즌들의 자발적인 기여로 작성되었으며, 저작권은 원저작자에게 있습니다. 본 사이트는 이에 상응하는 법적 책임을 지지 않습니다. 표절이나 침해가 의심되는 콘텐츠를 발견한 경우 admin@php.cn으로 문의하세요.

핫 AI 도구

Undresser.AI Undress

사실적인 누드 사진을 만들기 위한 AI 기반 앱

AI Clothes Remover

사진에서 옷을 제거하는 온라인 AI 도구입니다.

Undress AI Tool

무료로 이미지를 벗다

Clothoff.io

AI 옷 제거제

AI Hentai Generator

AI Hentai를 무료로 생성하십시오.

뜨거운 도구

메모장++7.3.1

사용하기 쉬운 무료 코드 편집기

SublimeText3 중국어 버전

중국어 버전, 사용하기 매우 쉽습니다.

스튜디오 13.0.1 보내기

강력한 PHP 통합 개발 환경

드림위버 CS6

시각적 웹 개발 도구

SublimeText3 Mac 버전

신 수준의 코드 편집 소프트웨어(SublimeText3)

뜨거운 주제

Gmail 이메일의 로그인 입구는 어디에 있나요?

7450

Cakephp 튜토리얼

1374

Steam의 계정 이름 형식은 무엇입니까?

Win11 활성화 키 영구

NYT 연결 힌트와 답변

Related knowledge

Ubuntu 및 Debian용 PHP 8.4 설치 및 업그레이드 가이드 Dec 24, 2024 pm 04:42 PM

PHP 8.4는 상당한 양의 기능 중단 및 제거를 통해 몇 가지 새로운 기능, 보안 개선 및 성능 개선을 제공합니다. 이 가이드에서는 Ubuntu, Debian 또는 해당 파생 제품에서 PHP 8.4를 설치하거나 PHP 8.4로 업그레이드하는 방법을 설명합니다.

CakePHP 데이터베이스 작업 Sep 10, 2024 pm 05:25 PM

CakePHP에서 데이터베이스 작업은 매우 쉽습니다. 이번 장에서는 CRUD(생성, 읽기, 업데이트, 삭제) 작업을 이해하겠습니다.

CakePHP 날짜 및 시간 Sep 10, 2024 pm 05:27 PM

cakephp4에서 날짜와 시간을 다루기 위해 사용 가능한 FrozenTime 클래스를 활용하겠습니다.

CakePHP 파일 업로드 Sep 10, 2024 pm 05:27 PM

파일 업로드 작업을 위해 양식 도우미를 사용할 것입니다. 다음은 파일 업로드의 예입니다.

CakePHP 라우팅 Sep 10, 2024 pm 05:25 PM

이번 장에서는 라우팅과 관련된 다음과 같은 주제를 학습하겠습니다.

CakePHP 토론 Sep 10, 2024 pm 05:28 PM

CakePHP는 PHP용 오픈 소스 프레임워크입니다. 이는 애플리케이션을 훨씬 쉽게 개발, 배포 및 유지 관리할 수 있도록 하기 위한 것입니다. CakePHP는 강력하고 이해하기 쉬운 MVC와 유사한 아키텍처를 기반으로 합니다. 모델, 뷰 및 컨트롤러 gu

CakePHP 유효성 검사기 만들기 Sep 10, 2024 pm 05:26 PM

컨트롤러에 다음 두 줄을 추가하면 유효성 검사기를 만들 수 있습니다.

CakePHP 로깅 Sep 10, 2024 pm 05:26 PM

CakePHP에 로그인하는 것은 매우 쉬운 작업입니다. 한 가지 기능만 사용하면 됩니다. cronjob과 같은 백그라운드 프로세스에 대해 오류, 예외, 사용자 활동, 사용자가 취한 조치를 기록할 수 있습니다. CakePHP에 데이터를 기록하는 것은 쉽습니다. log() 함수는 다음과 같습니다.

See all articles

php+mysql 협업 필터링 알고리즘 구현

핫 AI 도구

Undresser.AI Undress

AI Clothes Remover

Undress AI Tool

Clothoff.io

AI Hentai Generator

인기 기사

뜨거운 도구

메모장++7.3.1

SublimeText3 중국어 버전

스튜디오 13.0.1 보내기

드림위버 CS6

SublimeText3 Mac 버전

뜨거운 주제