Rumah pembangunan bahagian belakang Tutorial Python Bagaimana untuk Mengekstrak Baris dengan Cekap daripada Satu Pandas DataFrame yang Tidak Hadir dalam Satu Lagi?

Bagaimana untuk Mengekstrak Baris dengan Cekap daripada Satu Pandas DataFrame yang Tidak Hadir dalam Satu Lagi?

Dec 06, 2024 pm 06:44 PM

How to Efficiently Extract Rows from One Pandas DataFrame that are Absent in Another?

Mengambil Baris daripada Satu Bingkai Data yang Dikecualikan daripada Yang Lain

Dalam panda, adalah perkara biasa untuk mempunyai berbilang bingkai data dengan data yang berpotensi bertindih. Satu tugas yang kerap timbul ialah mengasingkan baris daripada satu kerangka data yang tidak terdapat dalam yang lain. Operasi ini amat berguna apabila bekerja dengan subset atau menapis data.

Perumusan Masalah:

Diberikan dua bingkai data panda, dengan df1 mengandungi superset baris berbanding df2, kami bertujuan untuk mendapatkan baris dalam df1 yang tidak terdapat dalam df2. Contoh di bawah menggambarkan senario ini dengan kes mudah:

import pandas as pd

df1 = pd.DataFrame(data={'col1': [1, 2, 3, 4, 5], 'col2': [10, 11, 12, 13, 14]})
df2 = pd.DataFrame(data={'col1': [1, 2, 3], 'col2': [10, 11, 12]})

print(df1)
print(df2)

# Expected result:
#   col1  col2
# 3     4    13
# 4     5    14
Salin selepas log masuk

Penyelesaian:

Untuk menangani masalah ini dengan berkesan, kami menggunakan teknik yang dikenali sebagai sambung kiri. Operasi ini menggabungkan df1 dan df2 sambil memastikan semua baris daripada df1 dikekalkan. Selain itu, kami menyertakan lajur penunjuk untuk mengenal pasti asal setiap baris selepas gabungan. Dengan memanfaatkan baris unik daripada df2 dan tidak termasuk pendua, kami mencapai hasil yang diingini.

Kod python di bawah melaksanakan penyelesaian ini:

df_all = df1.merge(df2.drop_duplicates(), on=['col1', 'col2'], how='left', indicator=True)
result = df_all[df_all['_merge'] == 'left_only']
Salin selepas log masuk

Penjelasan:

  1. Kiri Sertai: Fungsi gabungan melakukan gabungan kiri antara df1 dan df2.drop_duplicates(). Operasi ini menggabungkan baris daripada df1 dengan baris daripada df2 berdasarkan nilai yang sepadan dalam lajur col1 dan col2.
  2. Penunjuk Gabung: Parameter penunjuk ditetapkan kepada True untuk memasukkan lajur tambahan bernama _merge dalam rangka data yang terhasil df_all. Lajur ini menunjukkan asal setiap baris: 'kedua-duanya' untuk baris yang wujud dalam kedua-dua df1 dan df2, 'kiri_sahaja' untuk baris eksklusif kepada df1 dan 'kanan_sahaja' untuk baris eksklusif kepada df2.
  3. Tapis mengikut 'left_only': Untuk mengasingkan baris daripada df1 yang bukan dalam df2, kami tapis df_all dataframe dengan menyemak baris dengan _merge sama dengan 'left_only'. Ini memberikan kita hasil yang diingini.

Mengelakkan Perangkap Biasa:

Adalah penting untuk ambil perhatian bahawa sesetengah penyelesaian mungkin tersilap menyemak nilai lajur individu dan bukannya padanan baris secara keseluruhan. Pendekatan sedemikian boleh membawa kepada hasil yang salah, seperti yang digambarkan dalam contoh di bawah:

~df1.col1.isin(common.col1) & ~df1.col2.isin(common.col2)
Salin selepas log masuk

Kod ini tidak menganggap kejadian bersama nilai dalam baris dan mungkin menghasilkan hasil yang salah apabila baris dalam df1 mempunyai nilai yang muncul secara individu dalam df2 tetapi bukan dalam baris yang sama.

Dengan menggunakan pendekatan gabungan kiri yang diterangkan di atas, kami memastikan bahawa baris dikenal pasti dengan betul sebagai eksklusif untuk df1. Teknik ini menyediakan penyelesaian yang boleh dipercayai dan cekap untuk mengekstrak baris yang terdapat dalam satu bingkai data tetapi tidak dalam yang lain.

Atas ialah kandungan terperinci Bagaimana untuk Mengekstrak Baris dengan Cekap daripada Satu Pandas DataFrame yang Tidak Hadir dalam Satu Lagi?. Untuk maklumat lanjut, sila ikut artikel berkaitan lain di laman web China PHP!

Kenyataan Laman Web ini
Kandungan artikel ini disumbangkan secara sukarela oleh netizen, dan hak cipta adalah milik pengarang asal. Laman web ini tidak memikul tanggungjawab undang-undang yang sepadan. Jika anda menemui sebarang kandungan yang disyaki plagiarisme atau pelanggaran, sila hubungi admin@php.cn

Alat AI Hot

Undresser.AI Undress

Undresser.AI Undress

Apl berkuasa AI untuk mencipta foto bogel yang realistik

AI Clothes Remover

AI Clothes Remover

Alat AI dalam talian untuk mengeluarkan pakaian daripada foto.

Undress AI Tool

Undress AI Tool

Gambar buka pakaian secara percuma

Clothoff.io

Clothoff.io

Penyingkiran pakaian AI

Video Face Swap

Video Face Swap

Tukar muka dalam mana-mana video dengan mudah menggunakan alat tukar muka AI percuma kami!

Alat panas

Notepad++7.3.1

Notepad++7.3.1

Editor kod yang mudah digunakan dan percuma

SublimeText3 versi Cina

SublimeText3 versi Cina

Versi Cina, sangat mudah digunakan

Hantar Studio 13.0.1

Hantar Studio 13.0.1

Persekitaran pembangunan bersepadu PHP yang berkuasa

Dreamweaver CS6

Dreamweaver CS6

Alat pembangunan web visual

SublimeText3 versi Mac

SublimeText3 versi Mac

Perisian penyuntingan kod peringkat Tuhan (SublimeText3)

Bagaimana untuk menyelesaikan masalah kebenaran yang dihadapi semasa melihat versi Python di Terminal Linux? Bagaimana untuk menyelesaikan masalah kebenaran yang dihadapi semasa melihat versi Python di Terminal Linux? Apr 01, 2025 pm 05:09 PM

Penyelesaian kepada Isu Kebenaran Semasa Melihat Versi Python di Terminal Linux Apabila anda cuba melihat versi Python di Terminal Linux, masukkan Python ...

Bagaimana untuk mengelakkan dikesan oleh penyemak imbas apabila menggunakan fiddler di mana-mana untuk membaca lelaki-dalam-tengah? Bagaimana untuk mengelakkan dikesan oleh penyemak imbas apabila menggunakan fiddler di mana-mana untuk membaca lelaki-dalam-tengah? Apr 02, 2025 am 07:15 AM

Cara mengelakkan dikesan semasa menggunakan fiddlerevery di mana untuk bacaan lelaki-dalam-pertengahan apabila anda menggunakan fiddlerevery di mana ...

Bagaimana cara menyalin seluruh lajur satu data ke dalam data data lain dengan struktur yang berbeza di Python? Bagaimana cara menyalin seluruh lajur satu data ke dalam data data lain dengan struktur yang berbeza di Python? Apr 01, 2025 pm 11:15 PM

Apabila menggunakan Perpustakaan Pandas Python, bagaimana untuk menyalin seluruh lajur antara dua data data dengan struktur yang berbeza adalah masalah biasa. Katakan kita mempunyai dua DAT ...

Bagaimanakah uvicorn terus mendengar permintaan http tanpa serving_forever ()? Bagaimanakah uvicorn terus mendengar permintaan http tanpa serving_forever ()? Apr 01, 2025 pm 10:51 PM

Bagaimanakah Uvicorn terus mendengar permintaan HTTP? Uvicorn adalah pelayan web ringan berdasarkan ASGI. Salah satu fungsi terasnya ialah mendengar permintaan HTTP dan teruskan ...

Bagaimana Mengajar Asas Pengaturcaraan Pemula Komputer Dalam Kaedah Projek dan Masalah Dikemukakan Dalam masa 10 Jam? Bagaimana Mengajar Asas Pengaturcaraan Pemula Komputer Dalam Kaedah Projek dan Masalah Dikemukakan Dalam masa 10 Jam? Apr 02, 2025 am 07:18 AM

Bagaimana Mengajar Asas Pengaturcaraan Pemula Komputer Dalam masa 10 jam? Sekiranya anda hanya mempunyai 10 jam untuk mengajar pemula komputer beberapa pengetahuan pengaturcaraan, apa yang akan anda pilih untuk mengajar ...

Bagaimana untuk mendapatkan data berita yang melangkaui mekanisme anti-crawler Investing.com? Bagaimana untuk mendapatkan data berita yang melangkaui mekanisme anti-crawler Investing.com? Apr 02, 2025 am 07:03 AM

Memahami Strategi Anti-Crawling of Investing.com Ramai orang sering cuba merangkak data berita dari Investing.com (https://cn.investing.com/news/latest-news) ...

See all articles