Rumah pembangunan bahagian belakang Tutorial Python Bagaimanakah Panda Boleh Mengira Istilah dengan Cekap dalam DataFrames Berkumpulan?

Bagaimanakah Panda Boleh Mengira Istilah dengan Cekap dalam DataFrames Berkumpulan?

Nov 28, 2024 am 02:36 AM

How Can Pandas Efficiently Count Terms within Grouped DataFrames?

Mengira Istilah dalam Kumpulan DataFrames: Penyelesaian Pandas

Artikel ini menangani cabaran mengira istilah dalam kumpulan dan meringkaskan keputusan dalam DataFrame . Dengan Panda, tugas ini boleh diselesaikan dengan elegan tanpa menggunakan gelung yang tidak cekap. Pertimbangkan DataFrame berikut:

df = pd.DataFrame([
    (1, 1, 'term1'),
    (1, 2, 'term2'),
    (1, 1, 'term1'),
    (1, 1, 'term2'),
    (2, 2, 'term3'),
    (2, 3, 'term1'),
    (2, 2, 'term1')
])
Salin selepas log masuk

Matlamatnya adalah untuk mengumpulkan mengikut 'id' dan 'kumpulan' dan mengira kejadian setiap 'istilah'. Untuk mencapai matlamat ini, Pandas menawarkan penyelesaian ringkas:

df.groupby(['id', 'group', 'term']).size().unstack(fill_value=0)
Salin selepas log masuk
Salin selepas log masuk

Operasi ini mengumpulkan DataFrame mengikut lajur 'id', 'kumpulan' dan 'istilah', mengira kejadian setiap gabungan unik dan mengembalikan diringkaskan DataFrame dengan lajur berbilang indeks dan lajur nilai tunggal bernama 'saiz' yang mengandungi kiraan. Fungsi 'nyahtindan' membentuk semula DataFrame ke dalam format yang luas, dengan satu lajur untuk setiap istilah unik, seperti ditunjukkan di bawah:

id  group term   size
1   1     term1  3
    1     term2  2
    2     term3  1
2   2     term1  3
Salin selepas log masuk

Analisis Masa

Untuk lebih besar set data, memahami ciri prestasi penyelesaian ini adalah penting. Untuk menilai ini, pertimbangkan DataFrame dengan 1 juta baris yang dijana menggunakan kod berikut:

df = pd.DataFrame(dict(id=np.random.choice(100, 1000000),
                       group=np.random.choice(20, 1000000),
                       term=np.random.choice(10, 1000000)))
Salin selepas log masuk

Memprofilkan operasi pengumpulan dan pengiraan mendedahkan bahawa ia boleh mengendalikan set data yang besar dengan cekap:

df.groupby(['id', 'group', 'term']).size().unstack(fill_value=0)
Salin selepas log masuk
Salin selepas log masuk

Prestasi ini dikaitkan dengan sifat optimum mekanisme pengumpulan dan pengagregatan asas Pandas, menjadikannya alat yang sangat baik untuk bekerja dengan cekap dengan set data yang besar.

Atas ialah kandungan terperinci Bagaimanakah Panda Boleh Mengira Istilah dengan Cekap dalam DataFrames Berkumpulan?. Untuk maklumat lanjut, sila ikut artikel berkaitan lain di laman web China PHP!

Kenyataan Laman Web ini
Kandungan artikel ini disumbangkan secara sukarela oleh netizen, dan hak cipta adalah milik pengarang asal. Laman web ini tidak memikul tanggungjawab undang-undang yang sepadan. Jika anda menemui sebarang kandungan yang disyaki plagiarisme atau pelanggaran, sila hubungi admin@php.cn

Tag artikel panas

Notepad++7.3.1

Notepad++7.3.1

Editor kod yang mudah digunakan dan percuma

SublimeText3 versi Cina

SublimeText3 versi Cina

Versi Cina, sangat mudah digunakan

Hantar Studio 13.0.1

Hantar Studio 13.0.1

Persekitaran pembangunan bersepadu PHP yang berkuasa

Dreamweaver CS6

Dreamweaver CS6

Alat pembangunan web visual

SublimeText3 versi Mac

SublimeText3 versi Mac

Perisian penyuntingan kod peringkat Tuhan (SublimeText3)

Bagaimana saya menggunakan sup yang indah untuk menghuraikan html? Bagaimana saya menggunakan sup yang indah untuk menghuraikan html? Mar 10, 2025 pm 06:54 PM

Bagaimana saya menggunakan sup yang indah untuk menghuraikan html?

Penapisan gambar di python Penapisan gambar di python Mar 03, 2025 am 09:44 AM

Penapisan gambar di python

Cara Menggunakan Python untuk Mencari Pengagihan Zipf Fail Teks Cara Menggunakan Python untuk Mencari Pengagihan Zipf Fail Teks Mar 05, 2025 am 09:58 AM

Cara Menggunakan Python untuk Mencari Pengagihan Zipf Fail Teks

Cara Bekerja Dengan Dokumen PDF Menggunakan Python Cara Bekerja Dengan Dokumen PDF Menggunakan Python Mar 02, 2025 am 09:54 AM

Cara Bekerja Dengan Dokumen PDF Menggunakan Python

Cara Cache Menggunakan Redis dalam Aplikasi Django Cara Cache Menggunakan Redis dalam Aplikasi Django Mar 02, 2025 am 10:10 AM

Cara Cache Menggunakan Redis dalam Aplikasi Django

Bagaimana untuk melakukan pembelajaran mendalam dengan Tensorflow atau Pytorch? Bagaimana untuk melakukan pembelajaran mendalam dengan Tensorflow atau Pytorch? Mar 10, 2025 pm 06:52 PM

Bagaimana untuk melakukan pembelajaran mendalam dengan Tensorflow atau Pytorch?

Cara Melaksanakan Struktur Data Anda Sendiri di Python Cara Melaksanakan Struktur Data Anda Sendiri di Python Mar 03, 2025 am 09:28 AM

Cara Melaksanakan Struktur Data Anda Sendiri di Python

Pengenalan kepada pengaturcaraan selari dan serentak di Python Pengenalan kepada pengaturcaraan selari dan serentak di Python Mar 03, 2025 am 10:32 AM

Pengenalan kepada pengaturcaraan selari dan serentak di Python

See all articles