정규식은 어떻게 시리즈의 여러 하위 문자열에 대한 Pandas 필터링을 최적화할 수 있습니까?
시리즈의 여러 하위 문자열에 대한 Pandas 필터링 최적화
배경
문자열의 여러 하위 문자열을 기반으로 대규모 Pandas 데이터 프레임 필터링 열은 계산 비용이 많이 드는 작업일 수 있습니다. 기존 접근 방식은 각 하위 문자열에 마스크를 적용한 다음 논리 연산을 사용하여 이를 줄이는 것입니다.
제안 접근 방식
효율성을 높이기 위해 정규식을 활용하는 것이 좋습니다(이스케이프된 특수 문자) 부분 문자열 일치를 위한 것입니다. 정규식 파이프(|)를 사용하여 이스케이프된 하위 문자열을 결합하면 일치하는 항목이 발견될 때까지 문자열에 대해 각 하위 문자열을 테스트할 수 있습니다.
구현
import re # Escape special characters in substrings esc_lst = [re.escape(s) for s in lst] # Join escaped substrings using regex pipe pattern = '|'.join(esc_lst) # Filter based on concatenated pattern df[col].str.contains(pattern, case=False)
성능 고려 사항
수를 줄이면 성능이 향상됩니다. 행당 필요한 테스트 수입니다. 이 방법은 일치하는 항목이 발견될 때까지 하위 문자열을 확인하여 불필요한 반복을 제거합니다.
벤치마킹
50,000개의 문자열과 100개의 하위 문자열이 있는 샘플 데이터 프레임을 사용하여 제안된 방법은 대략 둘째, 기존 접근 방식의 5초와 비교됩니다. 이러한 성능 이점은 데이터 세트가 클수록 증가합니다.
결론
이스케이프된 특수 문자가 포함된 정규식을 활용하면 Pandas 데이터 프레임에서 여러 하위 문자열을 효율적으로 필터링하여 계산 오버헤드.
위 내용은 정규식은 어떻게 시리즈의 여러 하위 문자열에 대한 Pandas 필터링을 최적화할 수 있습니까?의 상세 내용입니다. 자세한 내용은 PHP 중국어 웹사이트의 기타 관련 기사를 참조하세요!

핫 AI 도구

Undresser.AI Undress
사실적인 누드 사진을 만들기 위한 AI 기반 앱

AI Clothes Remover
사진에서 옷을 제거하는 온라인 AI 도구입니다.

Undress AI Tool
무료로 이미지를 벗다

Clothoff.io
AI 옷 제거제

Video Face Swap
완전히 무료인 AI 얼굴 교환 도구를 사용하여 모든 비디오의 얼굴을 쉽게 바꾸세요!

인기 기사

뜨거운 도구

메모장++7.3.1
사용하기 쉬운 무료 코드 편집기

SublimeText3 중국어 버전
중국어 버전, 사용하기 매우 쉽습니다.

스튜디오 13.0.1 보내기
강력한 PHP 통합 개발 환경

드림위버 CS6
시각적 웹 개발 도구

SublimeText3 Mac 버전
신 수준의 코드 편집 소프트웨어(SublimeText3)

뜨거운 주제











Fiddlerevery Where를 사용할 때 Man-in-the-Middle Reading에 Fiddlereverywhere를 사용할 때 감지되는 방법 ...

Linux 터미널에서 Python 사용 ...

10 시간 이내에 컴퓨터 초보자 프로그래밍 기본 사항을 가르치는 방법은 무엇입니까? 컴퓨터 초보자에게 프로그래밍 지식을 가르치는 데 10 시간 밖에 걸리지 않는다면 무엇을 가르치기로 선택 하시겠습니까?

Pythonasyncio에 대해 ...

Investing.com의 크롤링 전략 이해 많은 사람들이 종종 Investing.com (https://cn.investing.com/news/latest-news)에서 뉴스 데이터를 크롤링하려고합니다.

Python 3.6에 피클 파일 로딩 3.6 환경 오류 : ModulenotFounderRor : nomodulename ...

SCAPY 크롤러를 사용할 때 파이프 라인 파일을 작성할 수없는 이유에 대한 논의 지속적인 데이터 저장을 위해 SCAPY 크롤러를 사용할 때 파이프 라인 파일이 발생할 수 있습니다 ...
