Java实现读取文章中重复出现的中文字符串的示例代码分析
本文主要介绍了Java实现读取文章中重复出现的中文字符串的方法。具有很好的参考价值。下面跟着小编一起来看下吧
在上个星期阿里巴巴一面的时候,最后面试官问我如何把一篇文章中重复出现的词或者句子找出来,当时太紧张,答的不是很好。今天有时间再来亲手实现一遍。其实说白了也就是字符串的处理,所以难度并不是很大。
以下是代码和运行效果:
实现方法:
import java.io.*; import java.util.*; /** * Created by chunmiao on 17-3-20. */ public class ReadArticle { //读取文件名称 private String filename; //读取段落 private ArrayList<String> result = new ArrayList<>(); //最小字长(两个字以上进行匹配) private final int MINSIZE = 2; //重复词储存 HashSet<String> set; public ReadArticle(String filename, HashSet<String> set) { this.filename = filename; this.set = set; } public void createData() throws IOException { String r; //读取文章内容 BufferedReader in = new BufferedReader(new FileReader(new File(filename).getAbsoluteFile())); try { while ((r = in.readLine()) != null) { //消除不必要的标点符号 r = r.replaceAll("\\s+ |“|\\[|‘|《| *|", "").trim(); //留下” , 。 。” ”。 ”, ? 》 -等作为划分句子的分割符标示 Collections.addAll(result, r.split(",|(。”|”(。|,)|。)|(\\])|”|'|?|:|》|-")); } }finally { in.close(); } //对文章内容进行遍历找出重读出现的句子或者是词语 for (int i = 0 ; i < result.size() - 1; i ++){ for (int j = 0 ; j < result.size() - i - 1; j ++) { //将重复出现的词语保存到set集合里面 set.addAll(getSameCharacter(result.get(i), result.get(j + i + 1))); } } } private ArrayList<String> getSameCharacter(String a1, String a2){ String maxS; String minS; //短句遍历开始处 int start = 0; //词的长度最短为两个字长 int range =2; //设定短句和长句s,使得遍历更加快捷 if (a1.length() <= a2.length()){ maxS = a2; minS = a1; }else { maxS = a1; minS = a2; } String result = ""; ArrayList<String> list = new ArrayList<String>(); //防止substring时超出范围 while (start + range <= minS.length()) { //如果句子或词在对象里面,则找出相应的句子或词保存在list里面 if (maxS.indexOf(minS.substring(start, start + range)) != -1) { //获取最长句子,删除短句子 list.remove(result); list.add(minS.substring(start, start + range)); result = minS.substring(start, start + range); range++; continue; } range = MINSIZE; start++; } return list; } }
测试代码:
import java.io.IOException; import java.util.HashSet; public class Main { public static void main(String[] args) throws IOException { String filename = "test.txt"; HashSet<String> result = new HashSet<String>(); ReadArticle read = new ReadArticle(filename,result); read.createData(); System.out.println("这篇文章中的重复出现的词或句子有以下几个词或句子:\n"); for (String s : result){ System.out.println(s); } } }
读取的文章内容:
正则匹配结果(去掉多余字符):
字符串转换成ArrayList:
最终处理结果:
其实从上面的结果可以看出。单纯的操控字符串并不能判断它是否是一个完整的词和句,应该还要配合数据库字典来匹配上面的结果,从而找出真正的词和句
Atas ialah kandungan terperinci Java实现读取文章中重复出现的中文字符串的示例代码分析. Untuk maklumat lanjut, sila ikut artikel berkaitan lain di laman web China PHP!

Alat AI Hot

Undresser.AI Undress
Apl berkuasa AI untuk mencipta foto bogel yang realistik

AI Clothes Remover
Alat AI dalam talian untuk mengeluarkan pakaian daripada foto.

Undress AI Tool
Gambar buka pakaian secara percuma

Clothoff.io
Penyingkiran pakaian AI

Video Face Swap
Tukar muka dalam mana-mana video dengan mudah menggunakan alat tukar muka AI percuma kami!

Artikel Panas

Alat panas

Notepad++7.3.1
Editor kod yang mudah digunakan dan percuma

SublimeText3 versi Cina
Versi Cina, sangat mudah digunakan

Hantar Studio 13.0.1
Persekitaran pembangunan bersepadu PHP yang berkuasa

Dreamweaver CS6
Alat pembangunan web visual

SublimeText3 versi Mac
Perisian penyuntingan kod peringkat Tuhan (SublimeText3)

Topik panas





Panduan Nombor Sempurna di Jawa. Di sini kita membincangkan Definisi, Bagaimana untuk menyemak nombor Perfect dalam Java?, contoh dengan pelaksanaan kod.

Panduan untuk Weka di Jawa. Di sini kita membincangkan Pengenalan, cara menggunakan weka java, jenis platform, dan kelebihan dengan contoh.

Panduan untuk Nombor Smith di Jawa. Di sini kita membincangkan Definisi, Bagaimana untuk menyemak nombor smith di Jawa? contoh dengan pelaksanaan kod.

Dalam artikel ini, kami telah menyimpan Soalan Temuduga Spring Java yang paling banyak ditanya dengan jawapan terperinci mereka. Supaya anda boleh memecahkan temuduga.

Java 8 memperkenalkan API Stream, menyediakan cara yang kuat dan ekspresif untuk memproses koleksi data. Walau bagaimanapun, soalan biasa apabila menggunakan aliran adalah: bagaimana untuk memecahkan atau kembali dari operasi foreach? Gelung tradisional membolehkan gangguan awal atau pulangan, tetapi kaedah Foreach Stream tidak menyokong secara langsung kaedah ini. Artikel ini akan menerangkan sebab -sebab dan meneroka kaedah alternatif untuk melaksanakan penamatan pramatang dalam sistem pemprosesan aliran. Bacaan Lanjut: Penambahbaikan API Java Stream Memahami aliran aliran Kaedah Foreach adalah operasi terminal yang melakukan satu operasi pada setiap elemen dalam aliran. Niat reka bentuknya adalah

Panduan untuk TimeStamp to Date di Java. Di sini kita juga membincangkan pengenalan dan cara menukar cap waktu kepada tarikh dalam java bersama-sama dengan contoh.

Kapsul adalah angka geometri tiga dimensi, terdiri daripada silinder dan hemisfera di kedua-dua hujungnya. Jumlah kapsul boleh dikira dengan menambahkan isipadu silinder dan jumlah hemisfera di kedua -dua hujungnya. Tutorial ini akan membincangkan cara mengira jumlah kapsul yang diberikan dalam Java menggunakan kaedah yang berbeza. Formula volum kapsul Formula untuk jumlah kapsul adalah seperti berikut: Kelantangan kapsul = isipadu isipadu silinder Dua jumlah hemisfera dalam, R: Radius hemisfera. H: Ketinggian silinder (tidak termasuk hemisfera). Contoh 1 masukkan Jejari = 5 unit Ketinggian = 10 unit Output Jilid = 1570.8 Unit padu menjelaskan Kirakan kelantangan menggunakan formula: Kelantangan = π × r2 × h (4

Java ialah bahasa pengaturcaraan popular yang boleh dipelajari oleh pembangun pemula dan berpengalaman. Tutorial ini bermula dengan konsep asas dan diteruskan melalui topik lanjutan. Selepas memasang Kit Pembangunan Java, anda boleh berlatih pengaturcaraan dengan mencipta program "Hello, World!" Selepas anda memahami kod, gunakan gesaan arahan untuk menyusun dan menjalankan program, dan "Hello, World!" Pembelajaran Java memulakan perjalanan pengaturcaraan anda, dan apabila penguasaan anda semakin mendalam, anda boleh mencipta aplikasi yang lebih kompleks.
