ホームページ バックエンド開発 Python チュートリアル データ分析のための Python ラーニング パス

データ分析のための Python ラーニング パス

Jun 23, 2017 pm 04:25 PM
analysis data for python 勉強 ノート

序章では、MovieLens 1M データセットの処理例が紹介されています。この本では、データ セットが GroupLens Research () から提供されていることが紹介されています。このアドレスからは、MovieLens の Web サイトからさまざまな評価データ セットが提供されているところに直接ジャンプできます。必要な MovieLens 1M データ セットは、対応する圧縮パッケージをダウンロードできます。そこにもあります。

ダウンロードして解凍したフォルダーは次のとおりです:

この例では、これら 3 つのデータ テーブルが使用されます。私が読んだ「Python For Data Analysis」の中国語版 (PDF) は 2014 年の初版です。その中のすべての例は Python 2.7 と pandas 0.8.2 に基づいて書かれており、私は Python 3.5.2 と pandas 0.8 をインストールしました。 2. pandas 0.20.2 では、一部の関数とメソッドがまったく異なりますが、その一部は新しいバージョンで変更されたパラメーターですが、一部は新しいバージョンでは非推奨になっています。これにより、本の When サンプル コードに従って実行することができました。 、いくつかのエラーと警告が発生します。 MovieLens 1M データ セット コードを私と同じ構成環境でテストすると、次の問題が発生します。

  • dat データを pandas DataFrame オブジェクトに読み取るとき、本に記載されているコードは次のとおりです:

    users = pd.read_table('ml-1m/users.dat', sep='::', header=None, names=unames)
    
    rnames = ['user_id', 'movie_id', 'rating', 'timestamp']
    ratings = pd.read_table('ml-1m/ratings.dat', sep='::', header=None, names=rnames)
    
    mnames = ['movie_id', 'title', 'genres']
    movies = pd.read_table('ml-1m/movies.dat', sep='::', header=None, names=mnames)
    ログイン後にコピー

    直接実行する場合、警告:

    F:/python/HelloWorld/DataAnalysisByPython-1.py:4: ParserWarning: Falling back to the 'python' engine because the 'c' engine does not support regex separators (separators > 1 char and different from '\s+' are interpreted as regex); you can avoid this warning by specifying engine='python'.
      users = pd.read_table('ml-1m/users.dat', sep='::', header=None, names=unames)
    F:/python/HelloWorld/DataAnalysisByPython-1.py:7: ParserWarning: Falling back to the 'python' engine because the 'c' engine does not support regex separators (separators > 1 char and different from '\s+' are interpreted as regex); you can avoid this warning by specifying engine='python'.
      ratings = pd.read_table('ml-1m/ratings.dat', sep='::', header=None, names=rnames)
    F:/python/HelloWorld/DataAnalysisByPython-1.py:10: ParserWarning: Falling back to the 'python' engine because the 'c' engine does not support regex separators (separators > 1 char and different from '\s+' are interpreted as regex); you can avoid this warning by specifying engine='python'.
      movies = pd.read_table('ml-1m/movies.dat', sep='::', header=None, names=mnames)
    ログイン後にコピー

    ただし、それも可能ですしかし、完璧な強迫性障害である私は、それでもこの警告を解決したいと思っています。この警告は、「C」エンジンがサポートしていないため、「Python」エンジンにのみフォールバックでき、pandas.read_table メソッドにエンジン パラメータが存在し、これはどの解析エンジンを設定するために使用されることを意味します。 「C」と「Python」を含む、これら 2 つのオプションを使用します。 「C」エンジンはこれをサポートしていないため、エンジンを「Python」に設定するだけで済みます。

    users = pd.read_table('ml-1m/users.dat', sep='::', header=None, names=unames, engine = 'python')
    
    rnames = ['user_id', 'movie_id', 'rating', 'timestamp']
    ratings = pd.read_table('ml-1m/ratings.dat', sep='::', header=None, names=rnames, engine = 'python')
    
    mnames = ['movie_id', 'title', 'genres']
    movies = pd.read_table('ml-1m/movies.dat', sep='::', header=None, names=mnames, engine = 'python')
    ログイン後にコピー

  • pivot_table メソッドを使用して、集計されたデータの性別ごとの各映画の平均スコアを計算します。本に記載されているコードは次のとおりです。 、エラーが報告されます: このコードは実行できません:

    mean_ratings = data.pivot_table('rating', rows='title', cols='gender', aggfunc='mean')
    ログイン後にコピー

    TypeError は、ここの 'rows' パラメータがメソッドで使用可能なキーワード パラメータではないことを示しています。公式 Web サイトにアクセスして pandas API の使用法ドキュメント () を確認したところ、

    pandas.pivot_table のキーワード パラメーターがバージョン 0.20.2 で変更されたことが原因であることがわかりました。同じ効果を達成するには、行をインデックスに置き換えるだけです。同時に、cols パラメーターはなく、代わりに列を使用する必要があります。

    Traceback (most recent call last):
      File "F:/python/HelloWorld/DataAnalysisByPython-1.py", line 19, in <module>mean_ratings = data.pivot_table('rating', rows='title', cols='gender', aggfunc='mean')
    TypeError: pivot_table() got an unexpected keyword argument 'rows'
    ログイン後にコピー
    女性視聴者の好きな映画を理解するために、DataFrame メソッドを使用して列 F を降順に並べ替えます。本のサンプル コードは次のとおりです。警告はプログラムに干渉しません:

mean_ratings = data.pivot_table('rating', index='title', columns='gender', aggfunc='mean')
ログイン後にコピー
  • これは、並べ替えのためのsort_indexメソッドが将来言語またはライブラリで変更される可能性があり、代わりにsort_valuesを使用することが推奨されることを意味します。 API 使用法のドキュメントでは、pandas.DataFrame.sort_index の説明は「ラベルごとにオブジェクトを (軸に沿って) 並べ替える」となっており、一方、pandas.DataFrame.sort_values の説明は「いずれかの軸に沿った値によって並べ替える」となっています。どちらも同じ効果を得るには、sort_values に置き換えます。 sort_index は次の「スコア差の計算

    」でも使用されますが、sort_values で置き換えることもできます。

    top_female_ratings = mean_ratings.sort_index(by='F', ascending=False)
    ログイン後にコピー

    最後のエラーはまだ並べ替えに関連しています。 「評価乖離の計算」でスコアデータの標準偏差を計算した後、フィルターされた値に基づいて系列が降順に並べ替えられます。本のコードは次のとおりです:

    F:/python/HelloWorld/DataAnalysisByPython-1.py:32: FutureWarning: by argument to sort_index is deprecated, pls use .sort_values(by=...)
      top_female_ratings = mean_ratings.sort_index(by='F', ascending=False)
    ログイン後にコピー

    这里的错误是:

    Traceback (most recent call last):
      File "F:/python/HelloWorld/DataAnalysisByPython-1.py", line 47, in <module>print(rating_std_by_title.order(ascending=False)[:10])
      File "E:\Program Files\Python35\lib\site-packages\pandas\core\generic.py", line 2970, in __getattr__return object.__getattribute__(self, name)
    AttributeError: 'Series' object has no attribute 'order'
    ログイン後にコピー

    居然已经没有这个order的方法了,只好去API文档中找替代的方法用。有两个,sort_index和sort_values,这和DataFrame中的方法一样,为了保险起见,我选择使用sort_values:

    print(rating_std_by_title.sort_values(ascending=False)[:10]
    ログイン後にコピー

    得到的结果和数据展示的结果一样,可以放心使用。

  • 第三方库不同版本间的差异还是挺明显的,建议是使用最新的版本,在使用时配合官网网站上的API使用文档,轻松解决各类问题~

    以上がデータ分析のための Python ラーニング パスの詳細内容です。詳細については、PHP 中国語 Web サイトの他の関連記事を参照してください。

    このウェブサイトの声明
    この記事の内容はネチズンが自主的に寄稿したものであり、著作権は原著者に帰属します。このサイトは、それに相当する法的責任を負いません。盗作または侵害の疑いのあるコンテンツを見つけた場合は、admin@php.cn までご連絡ください。

    ホットAIツール

    Undresser.AI Undress

    Undresser.AI Undress

    リアルなヌード写真を作成する AI 搭載アプリ

    AI Clothes Remover

    AI Clothes Remover

    写真から衣服を削除するオンライン AI ツール。

    Undress AI Tool

    Undress AI Tool

    脱衣画像を無料で

    Clothoff.io

    Clothoff.io

    AI衣類リムーバー

    Video Face Swap

    Video Face Swap

    完全無料の AI 顔交換ツールを使用して、あらゆるビデオの顔を簡単に交換できます。

    ホットツール

    メモ帳++7.3.1

    メモ帳++7.3.1

    使いやすく無料のコードエディター

    SublimeText3 中国語版

    SublimeText3 中国語版

    中国語版、とても使いやすい

    ゼンドスタジオ 13.0.1

    ゼンドスタジオ 13.0.1

    強力な PHP 統合開発環境

    ドリームウィーバー CS6

    ドリームウィーバー CS6

    ビジュアル Web 開発ツール

    SublimeText3 Mac版

    SublimeText3 Mac版

    神レベルのコード編集ソフト(SublimeText3)

    PHPとPythonの選択:ガイド PHPとPythonの選択:ガイド Apr 18, 2025 am 12:24 AM

    PHPはWeb開発と迅速なプロトタイピングに適しており、Pythonはデータサイエンスと機械学習に適しています。 1.PHPは、単純な構文と迅速な開発に適した動的なWeb開発に使用されます。 2。Pythonには簡潔な構文があり、複数のフィールドに適しており、強力なライブラリエコシステムがあります。

    PHPおよびPython:さまざまなパラダイムが説明されています PHPおよびPython:さまざまなパラダイムが説明されています Apr 18, 2025 am 12:26 AM

    PHPは主に手順プログラミングですが、オブジェクト指向プログラミング(OOP)もサポートしています。 Pythonは、OOP、機能、手続き上のプログラミングなど、さまざまなパラダイムをサポートしています。 PHPはWeb開発に適しており、Pythonはデータ分析や機械学習などのさまざまなアプリケーションに適しています。

    Windows 8でコードを実行できます Windows 8でコードを実行できます Apr 15, 2025 pm 07:24 PM

    VSコードはWindows 8で実行できますが、エクスペリエンスは大きくない場合があります。まず、システムが最新のパッチに更新されていることを確認してから、システムアーキテクチャに一致するVSコードインストールパッケージをダウンロードして、プロンプトとしてインストールします。インストール後、一部の拡張機能はWindows 8と互換性があり、代替拡張機能を探すか、仮想マシンで新しいWindowsシステムを使用する必要があることに注意してください。必要な拡張機能をインストールして、適切に動作するかどうかを確認します。 Windows 8ではVSコードは実行可能ですが、開発エクスペリエンスとセキュリティを向上させるために、新しいWindowsシステムにアップグレードすることをお勧めします。

    Visual StudioコードはPythonで使用できますか Visual StudioコードはPythonで使用できますか Apr 15, 2025 pm 08:18 PM

    VSコードはPythonの書き込みに使用でき、Pythonアプリケーションを開発するための理想的なツールになる多くの機能を提供できます。ユーザーは以下を可能にします。Python拡張機能をインストールして、コードの完了、構文の強調表示、デバッグなどの関数を取得できます。デバッガーを使用して、コードを段階的に追跡し、エラーを見つけて修正します。バージョンコントロールのためにGitを統合します。コードフォーマットツールを使用して、コードの一貫性を維持します。糸くずツールを使用して、事前に潜在的な問題を発見します。

    VSCODE拡張機能は悪意がありますか? VSCODE拡張機能は悪意がありますか? Apr 15, 2025 pm 07:57 PM

    VSコード拡張機能は、悪意のあるコードの隠れ、脆弱性の活用、合法的な拡張機能としての自慰行為など、悪意のあるリスクを引き起こします。悪意のある拡張機能を識別する方法には、パブリッシャーのチェック、コメントの読み取り、コードのチェック、およびインストールに注意してください。セキュリティ対策には、セキュリティ認識、良好な習慣、定期的な更新、ウイルス対策ソフトウェアも含まれます。

    ターミナルVSCODEでプログラムを実行する方法 ターミナルVSCODEでプログラムを実行する方法 Apr 15, 2025 pm 06:42 PM

    VSコードでは、次の手順を通じて端末でプログラムを実行できます。コードを準備し、統合端子を開き、コードディレクトリが端末作業ディレクトリと一致していることを確認します。プログラミング言語(pythonのpython your_file_name.pyなど)に従って実行コマンドを選択して、それが正常に実行されるかどうかを確認し、エラーを解決します。デバッガーを使用して、デバッグ効率を向上させます。

    Python vs. JavaScript:学習曲線と使いやすさ Python vs. JavaScript:学習曲線と使いやすさ Apr 16, 2025 am 12:12 AM

    Pythonは、スムーズな学習曲線と簡潔な構文を備えた初心者により適しています。 JavaScriptは、急な学習曲線と柔軟な構文を備えたフロントエンド開発に適しています。 1。Python構文は直感的で、データサイエンスやバックエンド開発に適しています。 2。JavaScriptは柔軟で、フロントエンドおよびサーバー側のプログラミングで広く使用されています。

    vscodeはMacに使用できますか vscodeはMacに使用できますか Apr 15, 2025 pm 07:36 PM

    VSコードはMacで利用できます。強力な拡張機能、GIT統合、ターミナル、デバッガーがあり、豊富なセットアップオプションも提供しています。ただし、特に大規模なプロジェクトまたは非常に専門的な開発の場合、コードと機能的な制限がある場合があります。

    See all articles