Pandas を使用して列内のテキストを複数の行に分割する
複数の行に分割する必要がある文字列を含む表形式のデータを操作する場合、パンダと Python を活用すると、このタスクに非常に役立ちます。 CSV ファイルに、特定の区切り文字で分割する必要があるテキストを含む列が含まれているシナリオを考えてみましょう。
問題ステートメント
「」という名前の列を含む CSV ファイルがあるとします。 Seatblocks」には、複数の座席セットを表す文字列が含まれており、各座席はスペースとコロンで区切られています。目標は、これらのシート セットを別々の列に分割することです。たとえば、次の Seatblocks 列:
2:218:10:4,6 1:13:36:1,12 1:13:37:1,13
は 3 つの別々の行になります:
2:218:10:4,6 1:13:36:1,12 1:13:37:1,13
Pandas を使用したソリューション
効率的にSeatblocks 列を分割して複数の行を作成すると、以下を利用できます。手順:
スペースで分割: str.split() メソッドを使用して、「シートブロック」列の各セル内のテキストをスペースで分割します:
s = df['Seatblocks'].str.split(' ')
シリーズを適用する関数: スペースで区切られた文字列の結果のリストをデータフレームに変換するには、各リストに Series 関数を適用します:
s = s.apply(Series, 1)
Flatten DataFrame: 新しいデータフレームを積み重ねて 1 列に平坦化しますデータフレーム:
s = s.stack()
インデックスをリセットして列名を変更: 元のデータフレームのインデックスと一致するようにインデックスをリセットし、列の名前を次のように変更します。 'Seatblocks':
s.index = s.index.droplevel(-1) s.name = 'Seatblocks'
元の列を削除: データフレームから元の "Seatblocks" 列を削除します:
del df['Seatblocks']
分割に参加DataFrame: 最後に、分割されたデータフレームを元のデータフレームと結合します:
df = df.join(s)
コロンによる分割の代替
Seatblocks 列はコロンで分割する必要があります。ソリューションを次のように変更できます。
s = df['Seatblocks'].str.split(' ') s = s.apply(lambda x: Series(x.split(':')))
これにより、コロンで区切られた各文字列を独自の列に含むデータフレームが作成されます。
以上が区切り文字を使用して Pandas 列のテキストを複数の行に分割するにはどうすればよいですか?の詳細内容です。詳細については、PHP 中国語 Web サイトの他の関連記事を参照してください。