Menghuraikan URL dan pautan dalam XML menggunakan Python

王林
Lepaskan: 2023-08-07 22:49:49
asal
1050 orang telah melayarinya

Menghuraikan URL dan pautan dalam XML menggunakan Python

Tajuk: Menggunakan Python untuk menghuraikan URL dan pautan dalam XML

Dalam kerja pembangunan harian kami, kami sering menghadapi keperluan untuk mengekstrak URL dan pautan daripada fail XML. Artikel ini akan memperkenalkan cara menggunakan Python untuk menghuraikan URL dan pautan dalam XML, dan memberikan contoh kod yang sepadan.

1. Pengenalan kepada XML dan alat penghuraian
XML (Bahasa Penanda eXtensible) ialah bahasa penanda boleh diperluas yang digunakan untuk menandakan data dan digunakan secara meluas dalam bidang seperti pembangunan web dan interaksi data. Dalam Python, kita boleh menghuraikan fail XML menggunakan modul xml.etree.ElementTree terbina dalam.

2. Import modul dan persediaan yang diperlukan
Sebelum bermula, kami perlu mengimport modul yang diperlukan, antaranya xml.etree.ElementTree akan digunakan untuk menghuraikan fail XML dan modul semula akan digunakan untuk memproses ungkapan biasa. Pada masa yang sama, kami juga perlu menyediakan sampel fail XML, kodnya adalah seperti berikut:

import xml.etree.ElementTree as ET
import re

# 示例XML文件内容
xml_string = '''
<root>
    <item>
        <title>百度</title>
        <link>https://www.baidu.com</link>
    </item>
    <item>
        <title>谷歌</title>
        <link>https://www.google.com</link>
    </item>
    <item>
        <title>必应</title>
        <link>https://www.bing.com</link>
    </item>
</root>
'''
Salin selepas log masuk

Dalam contoh di atas, kami mencipta nod akar XML yang mengandungi tiga sub-elemen item, dan menetapkan tajuk dan pautan untuk setiap item elemen kanak-kanak sub-elemen.

3 Menghuraikan URL dan pautan dalam fail XML
Seterusnya, kami mula menghuraikan URL dan pautan dalam fail XML. Langkah-langkah untuk menghuraikan fail XML adalah seperti berikut:

  1. Cipta objek ElementTree dan dapatkan nod akar

    root = ET.fromstring(xml_string)
    Salin selepas log masuk
  2. Lintas sub-elemen item di bawah nod akar

    for item in root.iter('item'):
    Salin selepas log masuk
  3. dapatkan teks tajuk dan pautkan sub-elemen di bawah item sub-elemen Kandungan

     title = item.find('title').text
     link = item.find('link').text
    Salin selepas log masuk

  4. Gunakan ungkapan biasa untuk menentukan sama ada kandungan teks ialah pautan URL

     is_link = re.match(r'^https?://(?:[-w.]|(?:%[da-fA-F]{2}))+$', link)
    Salin selepas log masuk

  5. Cetak tajuk dan pautan

     if is_link:
         print('标题:', title)
         print('链接:', link)
    Salin selepas log masuk

Contoh kod lengkap adalah seperti berikut:

import xml.etree.ElementTree as ET
import re

xml_string = '''
<root>
    <item>
        <title>百度</title>
        <link>https://www.baidu.com</link>
    </item>
    <item>
        <title>谷歌</title>
        <link>https://www.google.com</link>
    </item>
    <item>
        <title>必应</title>
        <link>https://www.bing.com</link>
    </item>
</root>
'''

root = ET.fromstring(xml_string)

for item in root.iter('item'):
    title = item.find('title').text
    link = item.find('link').text
    is_link = re.match(r'^https?://(?:[-w.]|(?:%[da-fA-F]{2}))+$', link)
    
    if is_link:
        print('标题:', title)
        print('链接:', link)
Salin selepas log masuk

Empat Jalankan dan keluarkan keputusan

Kami menjalankan kod di atas, anda akan mendapat hasil berikut:

标题: 百度
链接: https://www.baidu.com
标题: 谷歌
链接: https://www.google.com
标题: 必应
链接: https://www.bing.com
Salin selepas log masuk
Kod di atas melaksanakan penghuraian URL dan pautan dalam fail XML, dan melakukan pengesahan format pautan URL yang mudah. Melalui pengenalan artikel ini, kami boleh menggunakan Python dengan cepat dan mudah untuk menghuraikan URL dan pautan dalam fail XML, yang memudahkan pemprosesan dan aplikasi selanjutnya dalam pembangunan sebenar.

Ringkasan:

Artikel ini memperkenalkan cara menggunakan Python untuk menghuraikan URL dan pautan dalam XML Melalui penggunaan modul xml.etree.ElementTree, kami boleh menghuraikan fail XML dengan mudah dan mengekstrak URL dan pautan di dalamnya. Pada masa yang sama, kami juga menggunakan ungkapan biasa untuk melakukan pengesahan format ringkas pada pautan. Saya harap artikel ini akan membantu kerja penghuraian XML anda dalam pembangunan sebenar.

Atas ialah kandungan terperinci Menghuraikan URL dan pautan dalam XML menggunakan Python. Untuk maklumat lanjut, sila ikut artikel berkaitan lain di laman web China PHP!

Label berkaitan:
sumber:php.cn
Kenyataan Laman Web ini
Kandungan artikel ini disumbangkan secara sukarela oleh netizen, dan hak cipta adalah milik pengarang asal. Laman web ini tidak memikul tanggungjawab undang-undang yang sepadan. Jika anda menemui sebarang kandungan yang disyaki plagiarisme atau pelanggaran, sila hubungi admin@php.cn
Tutorial Popular
Lagi>
Muat turun terkini
Lagi>
kesan web
Kod sumber laman web
Bahan laman web
Templat hujung hadapan