Bagaimana untuk melaksanakan pembahagian dan pembahagian ayat teks Cina dalam Python-Tutorial Python-php.cn

Jadual Kandungan

一、问题

二、步骤

三、最后整体代码

Rumah

pembangunan bahagian belakang

Tutorial Python

Bagaimana untuk melaksanakan pembahagian dan pembahagian ayat teks Cina dalam Python

PHPz

Apr 29, 2023 pm 12:40 PM

python

一、问题

实现对文本的分句，大致来说主要是以中文的句号、感叹、问号等符号进行分句。难点在于直接分句可能会造成人物说话的语句也被分开！

二、步骤

分段

首先读取文本，文本读取后整体是一个字符串，每一个段之间是空白，所以分段之间按照空白分开来即可，最后存入一个paragraph_list，注意该list的下标就是段落的顺序号！其他的这里就不再多赘述！（可以查看最后的整体代码）

分句

首先拿到上面分好的paragraph_list，循环拿到每一段，然后对每一段直接按照分句规则（正则表达式）进行分句，参考该文章

import re

def cut_sent(para):
    para = re.sub(&#39;([。！？\?])([^”&#39;])&#39;, r"\1\n\2", para)
    para = re.sub(&#39;(\.{6})([^”&#39;])&#39;, r"\1\n\2", para)
    para = re.sub(&#39;(\…{2})([^”&#39;])&#39;, r"\1\n\2", para)
    para = re.sub(&#39;([。！？\?][”&#39;])([^，。！？\?])&#39;, r&#39;\1\n\2&#39;, para)
    para = para.rstrip()
    return para.split("\n")

# 这一段文字分句后应该有的结果
s = &#39;今天天气好啊！&#39; \
    &#39;温度高吗？你好，很高兴遇见你，真不错。&#39; \
    &#39;小明遇见小红说："你的衣服这好看！"&#39; \
    &#39;小红说："什么？衣服真好看？真的吗？"&#39; \
    &#39;小明回答到："嗯，真的！我也想买。"&#39;

for i in cut_sent(s):
    print(i)
    
#结果将人物语句也分开
"""
今天天气好啊！
温度高吗？
你好，很高兴遇见你，真不错。
小明遇见小红说："你的衣服这好看！
"小红说："什么？
衣服真好看？
真的吗？
"小明回答到："嗯，真的！
我也想买。
"
"""

Salin selepas log masuk

连接

这里解决办法就是循环每一句，识别："和"

两个符号均有，则该句直接就是一整句，直接就加入
两个符号都没有，则该句直接就是一整句，直接就加入
如果只有前面符号而无后面符号，则记录有前面符号那一句，依次往下拼接，直到遇到字符最后有“，将上面拼接好的语句作为一整句放入

def connect(paragraph):
    sentence_before = []
    sentence_after = []
    for each_para in paragraph:
        sentence_before.append(cut(each_para))
    # 核心代码！（将被错分的语句进行连接）
    for each in sentence_before:
        list = []
        sentence = ""
        FLAG = True # 非常关键！判断有&#39;：“&#39;的符号后面的语句是否继续拼接
        for i in each:
            if i.find(&#39;：“&#39;) * i.find(&#39;”&#39;) >= 0 and FLAG:
                list.append(i + sentence)
            else:
                FLAG = False
                sentence = sentence + i
                if i.find(&#39;”&#39;) > 0:
                    list.append(sentence)
                    sentence = ""
                    FLAG = True
        sentence_after.append(list)
    return sentence_after

Salin selepas log masuk

三、最后整体代码

import re
import pandas as pd

# 将整篇文章进行分段
def segments(url):
    raw = pd.read_csv(url,names=['txt'], sep='aaa', encoding="GBK" ,engine='python')

    def m_head(tem_str):
        return tem_str[:1]

    def m_mid(tmp_str):
        return tmp_str.find("回 ")
    raw['head'] = raw.txt.apply(m_head)
    raw['mid'] = raw.txt.apply(m_mid)
    raw['len'] = raw.txt.apply(len)
    chap_num = 0
    for i in range(len(raw)):
        if raw['head'][i] == "第" and raw['mid'][i] > 0 and raw['len'][i] < 30:
            chap_num += 1
        if chap_num >= 40 and raw['txt'][i] == "附录一：成吉思汗家族":
            chap_num = 0
        raw.loc[i, 'chap'] = chap_num
    del raw['head']
    del raw['mid']
    del raw['len']
    tmp_chap = raw[raw['chap'] == 7].copy()
    tmp_chap.reset_index(drop=True, inplace=True)
    tmp_chap['paraidx'] = tmp_chap.index
    paragraph = tmp_chap['txt'].values.tolist()
    return paragraph

# 将每段进行分句
def cut(para):
    # 相关规则
    pattern = ['([。！？\?])([^”'])','(\.{6})([^”'])','(\…{2})([^”'])','([。！？\?][”'])([^，。！？\?])']
    for i in pattern:
        para = re.sub(i, r"\1\n\2", para)
    para = para.rstrip()
    return para.split("\n")

# 将其中被错分的语句进行连接(主要是针对话语)
def connect(paragraph):
    sentence_before = []
    sentence_after = []
    for each_para in paragraph:
        sentence_before.append(cut(each_para))
    # 核心代码！（将被错分的语句进行连接）
    for each in sentence_before:
        list = []
        sentence = ""
        FLAG = True # 非常关键！判断有&#39;：“&#39;的符号后面的语句是否继续拼接
        for i in each:
            if i.find(&#39;：“&#39;) * i.find(&#39;”&#39;) >= 0 and FLAG:
                list.append(i + sentence)
            else:
                FLAG = False
                sentence = sentence + i
                if i.find(&#39;”&#39;) > 0:
                    list.append(sentence)
                    sentence = ""
                    FLAG = True
        sentence_after.append(list)
    return sentence_after

# 将最后的结果保存到DataFrame
def toDataFrame(list3):
    df = pd.DataFrame(columns=["content","paragraph","sentence"])
    for para_num,i in enumerate(list3):
       for sentence_num,j in enumerate(i):
            df_ = pd.DataFrame({"content": j, "paragraph": para_num,"sentence":sentence_num+1},index=[para_num])
            df = df.append(df_,ignore_index=True)
    for i in df['content'].values.tolist():
        print(i)

def main():
    # URL = "/Users/dengzhao/Downloads/金庸-射雕英雄传txt精校版.txt"
    URL = input("请输入文件地址：")
    para = segments(URL)
    result = connect(para)
    print(result)
    flag = input("以DataFrame形式输出数据(Y,N)：")
    if flag == 'Y':
        toDataFrame(result)
    elif flag == 'N':
        print("Thanks！！！！")
    else:
        print("程序结束！请检查的你的输入！")

if __name__ == '__main__':
    main()

Salin selepas log masuk

Atas ialah kandungan terperinci Bagaimana untuk melaksanakan pembahagian dan pembahagian ayat teks Cina dalam Python. Untuk maklumat lanjut, sila ikut artikel berkaitan lain di laman web China PHP!

Kenyataan Laman Web ini

Kandungan artikel ini disumbangkan secara sukarela oleh netizen, dan hak cipta adalah milik pengarang asal. Laman web ini tidak memikul tanggungjawab undang-undang yang sepadan. Jika anda menemui sebarang kandungan yang disyaki plagiarisme atau pelanggaran, sila hubungi admin@php.cn

Alat AI Hot

Undresser.AI Undress

Apl berkuasa AI untuk mencipta foto bogel yang realistik

AI Clothes Remover

Alat AI dalam talian untuk mengeluarkan pakaian daripada foto.

Undress AI Tool

Gambar buka pakaian secara percuma

Clothoff.io

Penyingkiran pakaian AI

AI Hentai Generator

Menjana ai hentai secara percuma.

Tunjukkan Lagi

Artikel Panas

R.E.P.O. Kristal tenaga dijelaskan dan apa yang mereka lakukan (kristal kuning)

2 minggu yang lalu By 尊渡假赌尊渡假赌尊渡假赌

Repo: Cara menghidupkan semula rakan sepasukan

4 minggu yang lalu By 尊渡假赌尊渡假赌尊渡假赌

Hello Kitty Island Adventure: Cara mendapatkan biji gergasi

3 minggu yang lalu By 尊渡假赌尊渡假赌尊渡假赌

Berapa lama masa yang diperlukan untuk mengalahkan fiksyen berpecah?

3 minggu yang lalu By DDD

R.E.P.O. Simpan Fail Lokasi: Di manakah & bagaimana untuk melindunginya?

3 minggu yang lalu By DDD

Tunjukkan Lagi

Alat panas

Notepad++7.3.1

Editor kod yang mudah digunakan dan percuma

SublimeText3 versi Cina

Versi Cina, sangat mudah digunakan

Hantar Studio 13.0.1

Persekitaran pembangunan bersepadu PHP yang berkuasa

Dreamweaver CS6

Alat pembangunan web visual

SublimeText3 versi Mac

Perisian penyuntingan kod peringkat Tuhan (SublimeText3)

Tunjukkan Lagi

Topik panas

Di manakah pintu masuk log masuk untuk e-mel gmail?

7321

Tutorial Java

1625

Tutorial CakePHP

1349

Tutorial Laravel

1261

Tutorial PHP

1209

Tunjukkan Lagi

Related knowledge

Bagaimana untuk mengintegrasikan perkhidmatan Node.js atau Python dengan cekap di bawah seni bina lampu? Apr 01, 2025 pm 02:48 PM

Ramai pemaju laman web menghadapi masalah mengintegrasikan perkhidmatan node.js atau python di bawah seni bina lampu: lampu sedia ada (Linux Apache MySQL PHP) Laman web seni bina memerlukan ...

Apakah sebabnya mengapa fail penyimpanan berterusan saluran paip tidak dapat ditulis apabila menggunakan crawler scapy? Apr 01, 2025 pm 04:03 PM

Apabila menggunakan crawler scapy, sebab mengapa fail penyimpanan berterusan paip tidak boleh ditulis? Perbincangan Ketika belajar menggunakan Crawler Scapy untuk Crawler Data, anda sering menemui ...

Apakah sebabnya mengapa Pool Proses Python mengendalikan permintaan TCP serentak dan menyebabkan pelanggan terjebak? Apr 01, 2025 pm 04:09 PM

Proses Python Pool mengendalikan permintaan TCP serentak yang menyebabkan pelanggan terjebak. Apabila menggunakan Python untuk pengaturcaraan rangkaian, adalah penting untuk mengendalikan permintaan TCP serentak dengan cekap. …

Bagaimana untuk melihat fungsi asal yang terkandung secara dalaman oleh python funcools.partial Object? Apr 01, 2025 pm 04:15 PM

Sangat meneroka kaedah tontonan python funcools.partial Object in Funcools.Partial Menggunakan Python ...

Bagaimana untuk menyelesaikan masalah kebenaran yang dihadapi semasa melihat versi Python di Terminal Linux? Apr 01, 2025 pm 05:09 PM

Penyelesaian kepada Isu Kebenaran Semasa Melihat Versi Python di Terminal Linux Apabila anda cuba melihat versi Python di Terminal Linux, masukkan Python ...

Pembangunan Aplikasi Desktop Cross-Platform Python: Perpustakaan GUI mana yang terbaik untuk anda? Apr 01, 2025 pm 05:24 PM

Pilihan Perpustakaan Pembangunan Aplikasi Desktop Python Python Banyak pemaju Python ingin membangunkan aplikasi desktop yang boleh dijalankan pada kedua-dua sistem Windows dan Linux ...

Python Hourglass Graph Lukisan: Bagaimana untuk mengelakkan kesilapan yang tidak ditentukan? Apr 01, 2025 pm 06:27 PM

Bermula dengan Python: Lukisan Grafik Hourglass dan Pengesahan Input Artikel ini akan menyelesaikan masalah definisi berubah -ubah yang dihadapi oleh pemula python dalam program lukisan grafik Hourglass. Kod ...

Bagaimana cara mengira dan menyusun set data produk yang besar di Python? Apr 01, 2025 pm 08:03 PM

Penukaran dan Statistik Data: Pemprosesan yang cekap bagi set data besar Artikel ini akan memperkenalkan secara terperinci bagaimana untuk menukar senarai data yang mengandungi maklumat produk kepada yang lain yang mengandungi ...

See all articles