Utilisation pratique des robots en Python : Kuwo music crawler-Tutoriel Python-php.cn

Maison

développement back-end

Tutoriel Python

Utilisation pratique des robots en Python : Kuwo music crawler

王林

Jun 09, 2023 pm 11:43 PM

python 音乐爬虫

À l'ère d'Internet, l'information est devenue extrêmement importante, les données sont devenues l'une des pierres angulaires de la valeur et les robots d'exploration Web sont l'un des outils importants pour obtenir et traiter les données. Le langage Python est devenu le langage de programmation de choix pour de nombreux programmeurs de robots d'exploration en raison de sa simplicité, de sa facilité d'apprentissage et de son efficacité. Dans cet article, nous utiliserons le langage Python pour explorer les données du site Web Kuwo Music à travers un cas pratique, et effectuer l'analyse et le traitement des données.

Kuwo Music est l'un des lecteurs de musique les plus connus en Chine, avec un grand nombre de ressources musicales et de groupes d'utilisateurs. Nous prendrons comme exemple le site Kuwo Music pour présenter le processus spécifique de mise en œuvre du crawl des données.

1. Analyse des données

Avant d'explorer, nous devons d'abord analyser la structure de la page Web et la méthode de stockage des données du site cible. En ouvrant la page Web de Kuwo Music, vous pouvez constater qu'il existe une corrélation évidente entre l'adresse de la page Web et l'ID de la musique. Ajoutez "/song/" et l'ID de la musique après l'adresse de la page Web pour accéder à la page détaillée de la musique correspondante.

Ouvrez la page détaillée d'une musique et constatez qu'il y a de nombreuses données précieuses, notamment le titre de la chanson, le chanteur, l'album, la durée de la chanson, le volume de lecture, le nombre de commentaires, etc. Ces informations sont stockées dans des fichiers HTML sous forme de balises de page Web. En examinant le code source de la page, vous constaterez que la plupart des informations pertinentes sont cachées dans des balises avec les classes "__songinfo__" et "__detailed_info clearfix__".

2. Implémentation du robot

Le cœur du robot est d'explorer les données. Nous implémentons l'exploration et la sauvegarde des données séparément.

Data crawling

Nous devons définir une fonction pour recevoir une liste contenant les identifiants de musique, accéder à la page de la musique correspondante et l'explorer utilement des informations. L'implémentation spécifique est la suivante :

import requests
from bs4 import BeautifulSoup

def get_music_info(musicids):
    musicinfo = []
    for musicid in musicids:
        url = 'http://www.kuwo.cn/play_detail/' + str(musicid)
        headers = {
            'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/58.0.3029.110 Safari/537.3'}
        response = requests.get(url, headers=headers)
        response.encoding = response.apparent_encoding
        soup = BeautifulSoup(response.text, 'html.parser')

        music_title = soup.find('h1', class_='info_tit').text.strip() # 歌曲名称
        artist = soup.find('p', class_='name').text.strip() # 歌手
        album = soup.find('a', class_='sname').text.strip() # 专辑
        duration = soup.find('span', class_='hilight').text.strip() # 歌曲时长
        play_counts = soup.find('em', class_='num').text.strip() # 播放量
        comments_counts = soup.find('em', class_='sub').text.strip() # 评论数

        musicinfo.append([musicid, music_title, artist, album, duration, play_counts, comments_counts])
        print('正在爬取音乐《{}》信息'.format(music_title))
    return musicinfo

Copier après la connexion

Le code ci-dessus utilise la bibliothèque de requêtes et la bibliothèque BeautifulSoup pour demander des pages Web et analyser les fichiers HTML afin d'obtenir des informations de balise utiles. Parmi eux, les en-têtes sont des en-têtes déguisés qui simulent l’accès au navigateur Chrome pour éviter d’être bloqués par le serveur.

2. Sauvegarde des données

Nous sauvegardons les données explorées au format CSV Avant utilisation, nous devons d'abord importer la bibliothèque CSV :

import csv

Copier après la connexion

. Ensuite, nous devons définir une fonction pour enregistrer les données et enregistrer les informations musicales explorées dans un fichier local au format CSV correct. L'implémentation spécifique est la suivante :

def save_csv(save_path, data_list):
    with open(save_path, 'w', newline='') as f:
        writer = csv.writer(f)
        writer.writerow(['歌曲ID', '歌曲名称', '歌手', '专辑', '歌曲时长', '播放量', '评论数'])
        writer.writerows(data_list)
    print("数据已保存至{}".format(save_path))

Copier après la connexion

Le code ci-dessus utilise le CSV. bibliothèque La méthodewriter() écrit les informations musicales dans un fichier. Il convient de noter que le délimiteur de fichier dans le fichier CSV est une virgule et que lors de l'écriture dans le fichier, vous devez utiliser newline='' pour corriger les lignes vides entre les lignes.

3. Analyse des données

Après avoir terminé l'exploration et la sauvegarde des données, nous pouvons commencer à analyser et à traiter les données. Dans le langage Python, des bibliothèques telles que pandas et matplotlib peuvent facilement implémenter l'analyse et la visualisation de données.

1. Importer la bibliothèque

L'analyse des données utilise principalement les bibliothèques pandas et matplotlib, nous devons donc utiliser le code suivant pour importer les bibliothèques associées :

import pandas as pd
import matplotlib.pyplot as plt
import seaborn as sns

Copier après la connexion

#🎜 🎜#2 .Lire les fichiers

Nous pouvons utiliser la fonction read_csv() dans la bibliothèque pandas pour lire le fichier CSV enregistré dans le DataFrame. L'implémentation spécifique est la suivante :

music_data = pd.read_csv('music_data.csv')

Copier après la connexion

#🎜. 🎜#3. Filtrage et tri des données

Nous pouvons utiliser la méthode sort_values() dans pandas pour trier les données par ordre décroissant en fonction des play_counts, et utiliser la méthode head() pour conserver uniquement la première. 20 données.

top_20_play_counts = music_data.sort_values('播放量', ascending=False).head(20)

Copier après la connexion

4. Visualisation des données

L'utilisation de la bibliothèque matplotlib pour réaliser la visualisation des données peut fournir une compréhension plus claire des relations et des tendances entre les données. Nous pouvons utiliser le code suivant pour tracer un graphique de courbe musicale des 20 meilleures pièces de musique Kuwo.

plt.figure(figsize=(20, 8)) # 设置图像大小
sns.lineplot(x='歌曲名称', y='播放量', data=top_20_play_counts) # 绘制曲线图
plt.xticks(rotation=90, fontsize=14) # 调整x轴刻度大小和旋转角度
plt.yticks(fontsize=14) # 调整y轴刻度大小
plt.xlabel('歌曲名称', fontsize=16) # 坐标轴标题
plt.ylabel('播放量', fontsize=16)
plt.title('酷我音乐播放量排名前20的歌曲', fontsize=20) # 图像标题
plt.show() # 显示图像

Copier après la connexion

Grâce au code ci-dessus, nous pouvons comprendre plus intuitivement la tendance de lecture des 20 meilleures chansons de Kuwo Music.

4. Résumé

Cet article décrit en détail l'utilisation du langage Python dans des combats de crawlers réels à travers un cas pratique. En analysant la structure de la page Web et la méthode de stockage des données, en utilisant les requêtes et les bibliothèques BeautifulSoup pour l'exploration des données, et enfin en utilisant les bibliothèques pandas et matplotlib pour l'analyse et la visualisation des données. J'espère avoir une meilleure compréhension de l'application du langage Python dans le domaine des robots d'exploration dans la pratique.

Ce qui précède est le contenu détaillé de. pour plus d'informations, suivez d'autres articles connexes sur le site Web de PHP en chinois!

Déclaration de ce site Web

Le contenu de cet article est volontairement contribué par les internautes et les droits d'auteur appartiennent à l'auteur original. Ce site n'assume aucune responsabilité légale correspondante. Si vous trouvez un contenu suspecté de plagiat ou de contrefaçon, veuillez contacter admin@php.cn

Outils d'IA chauds

Undresser.AI Undress

Application basée sur l'IA pour créer des photos de nu réalistes

AI Clothes Remover

Outil d'IA en ligne pour supprimer les vêtements des photos.

Undress AI Tool

Images de déshabillage gratuites

Clothoff.io

Dissolvant de vêtements AI

AI Hentai Generator

Générez AI Hentai gratuitement.

Afficher plus

Article chaud

R.E.P.O. Crystals d'énergie expliqués et ce qu'ils font (cristal jaune)

3 Il y a quelques semaines By 尊渡假赌尊渡假赌尊渡假赌

R.E.P.O. Meilleurs paramètres graphiques

3 Il y a quelques semaines By 尊渡假赌尊渡假赌尊渡假赌

Assassin's Creed Shadows: Solution d'énigmes de coquille

2 Il y a quelques semaines By DDD

R.E.P.O. Comment réparer l'audio si vous n'entendez personne

3 Il y a quelques semaines By 尊渡假赌尊渡假赌尊渡假赌

WWE 2K25: Comment déverrouiller tout dans Myrise

4 Il y a quelques semaines By 尊渡假赌尊渡假赌尊渡假赌

Afficher plus

Outils chauds

Bloc-notes++7.3.1

Éditeur de code facile à utiliser et gratuit

SublimeText3 version chinoise

Version chinoise, très simple à utiliser

Envoyer Studio 13.0.1

Puissant environnement de développement intégré PHP

Dreamweaver CS6

Outils de développement Web visuel

SublimeText3 version Mac

Logiciel d'édition de code au niveau de Dieu (SublimeText3)

Afficher plus

Sujets chauds

Où se trouve l'entrée de connexion pour la messagerie Gmail ?

7475

Tutoriel CakePHP

1377

Quel est le format du nom de compte de Steam

Clé d&amp;amp;amp;amp;amp;amp;#39;activation Win11 permanent

NYT Connexions Indices et réponses

Afficher plus

Related knowledge

MySQL doit-il payer Apr 08, 2025 pm 05:36 PM

MySQL a une version communautaire gratuite et une version d'entreprise payante. La version communautaire peut être utilisée et modifiée gratuitement, mais le support est limité et convient aux applications avec des exigences de stabilité faibles et des capacités techniques solides. L'Enterprise Edition fournit une prise en charge commerciale complète pour les applications qui nécessitent une base de données stable, fiable et haute performance et disposées à payer pour le soutien. Les facteurs pris en compte lors du choix d'une version comprennent la criticité des applications, la budgétisation et les compétences techniques. Il n'y a pas d'option parfaite, seulement l'option la plus appropriée, et vous devez choisir soigneusement en fonction de la situation spécifique.

Comment utiliser MySQL après l'installation Apr 08, 2025 am 11:48 AM

L'article présente le fonctionnement de la base de données MySQL. Tout d'abord, vous devez installer un client MySQL, tel que MySQLWorkBench ou le client de ligne de commande. 1. Utilisez la commande MySQL-UROot-P pour vous connecter au serveur et connecter avec le mot de passe du compte racine; 2. Utilisez Createdatabase pour créer une base de données et utilisez Sélectionner une base de données; 3. Utilisez CreateTable pour créer une table, définissez des champs et des types de données; 4. Utilisez InsertInto pour insérer des données, remettre en question les données, mettre à jour les données par mise à jour et supprimer les données par Supprimer. Ce n'est qu'en maîtrisant ces étapes, en apprenant à faire face à des problèmes courants et à l'optimisation des performances de la base de données que vous pouvez utiliser efficacement MySQL.

MySQL ne peut pas être installé après le téléchargement Apr 08, 2025 am 11:24 AM

Les principales raisons de la défaillance de l'installation de MySQL sont les suivantes: 1. Problèmes d'autorisation, vous devez s'exécuter en tant qu'administrateur ou utiliser la commande sudo; 2. Des dépendances sont manquantes et vous devez installer des packages de développement pertinents; 3. Conflits du port, vous devez fermer le programme qui occupe le port 3306 ou modifier le fichier de configuration; 4. Le package d'installation est corrompu, vous devez télécharger et vérifier l'intégrité; 5. La variable d'environnement est mal configurée et les variables d'environnement doivent être correctement configurées en fonction du système d'exploitation. Résolvez ces problèmes et vérifiez soigneusement chaque étape pour installer avec succès MySQL.

Le fichier de téléchargement MySQL est endommagé et ne peut pas être installé. Réparer la solution Apr 08, 2025 am 11:21 AM

Le fichier de téléchargement mysql est corrompu, que dois-je faire? Hélas, si vous téléchargez MySQL, vous pouvez rencontrer la corruption des fichiers. Ce n'est vraiment pas facile ces jours-ci! Cet article expliquera comment résoudre ce problème afin que tout le monde puisse éviter les détours. Après l'avoir lu, vous pouvez non seulement réparer le package d'installation MySQL endommagé, mais aussi avoir une compréhension plus approfondie du processus de téléchargement et d'installation pour éviter de rester coincé à l'avenir. Parlons d'abord de la raison pour laquelle le téléchargement des fichiers est endommagé. Il y a de nombreuses raisons à cela. Les problèmes de réseau sont le coupable. L'interruption du processus de téléchargement et l'instabilité du réseau peut conduire à la corruption des fichiers. Il y a aussi le problème avec la source de téléchargement elle-même. Le fichier serveur lui-même est cassé, et bien sûr, il est également cassé si vous le téléchargez. De plus, la numérisation excessive "passionnée" de certains logiciels antivirus peut également entraîner une corruption des fichiers. Problème de diagnostic: déterminer si le fichier est vraiment corrompu

MySQL a-t-il besoin d'Internet Apr 08, 2025 pm 02:18 PM

MySQL peut s'exécuter sans connexions réseau pour le stockage et la gestion des données de base. Cependant, la connexion réseau est requise pour l'interaction avec d'autres systèmes, l'accès à distance ou l'utilisation de fonctionnalités avancées telles que la réplication et le clustering. De plus, les mesures de sécurité (telles que les pare-feu), l'optimisation des performances (choisissez la bonne connexion réseau) et la sauvegarde des données sont essentielles pour se connecter à Internet.

Comment optimiser les performances de la base de données après l'installation de MySQL Apr 08, 2025 am 11:36 AM

L'optimisation des performances MySQL doit commencer à partir de trois aspects: configuration d'installation, indexation et optimisation des requêtes, surveillance et réglage. 1. Après l'installation, vous devez ajuster le fichier my.cnf en fonction de la configuration du serveur, tel que le paramètre innodb_buffer_pool_size, et fermer query_cache_size; 2. Créez un index approprié pour éviter les index excessifs et optimiser les instructions de requête, telles que l'utilisation de la commande Explication pour analyser le plan d'exécution; 3. Utilisez le propre outil de surveillance de MySQL (ShowProcessList, Showstatus) pour surveiller la santé de la base de données, et sauvegarde régulièrement et organisez la base de données. Ce n'est qu'en optimisant en continu ces étapes que les performances de la base de données MySQL peuvent être améliorées.

Comment optimiser les performances MySQL pour les applications de haute charge? Apr 08, 2025 pm 06:03 PM

Guide d'optimisation des performances de la base de données MySQL dans les applications à forte intensité de ressources, la base de données MySQL joue un rôle crucial et est responsable de la gestion des transactions massives. Cependant, à mesure que l'échelle de l'application se développe, les goulots d'étranglement des performances de la base de données deviennent souvent une contrainte. Cet article explorera une série de stratégies efficaces d'optimisation des performances MySQL pour garantir que votre application reste efficace et réactive dans des charges élevées. Nous combinerons des cas réels pour expliquer les technologies clés approfondies telles que l'indexation, l'optimisation des requêtes, la conception de la base de données et la mise en cache. 1. La conception de l'architecture de la base de données et l'architecture optimisée de la base de données sont la pierre angulaire de l'optimisation des performances MySQL. Voici quelques principes de base: sélectionner le bon type de données et sélectionner le plus petit type de données qui répond aux besoins peut non seulement économiser un espace de stockage, mais également améliorer la vitesse de traitement des données.

Solutions au service qui ne peuvent pas être démarrées après l'installation de MySQL Apr 08, 2025 am 11:18 AM

MySQL a refusé de commencer? Ne paniquez pas, vérifions-le! De nombreux amis ont découvert que le service ne pouvait pas être démarré après avoir installé MySQL, et ils étaient si anxieux! Ne vous inquiétez pas, cet article vous emmènera pour le faire face calmement et découvrez le cerveau derrière! Après l'avoir lu, vous pouvez non seulement résoudre ce problème, mais aussi améliorer votre compréhension des services MySQL et vos idées de problèmes de dépannage, et devenir un administrateur de base de données plus puissant! Le service MySQL n'a pas réussi et il y a de nombreuses raisons, allant des erreurs de configuration simples aux problèmes système complexes. Commençons par les aspects les plus courants. Connaissances de base: une brève description du processus de démarrage du service MySQL Service Startup. Autrement dit, le système d'exploitation charge les fichiers liés à MySQL, puis démarre le démon mysql. Cela implique la configuration

See all articles