PHP+Tidy－完美的XHTML纠错+过滤-php手册-php.cn

Rumah

php教程

php手册

PHP+Tidy－完美的XHTML纠错+过滤

WBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWB

Jun 13, 2016 pm 12:32 PM

xhtml 。 Fungsi dan asas nombor pengguna Pembetulan jaring Cantik masuk keluaran penapis

输入和输出
输入和输出应该说是很多网站的基本功能。用户输入数据，网站输出数据供其他人浏览。

拿目前流行的Blog为例，这里的输入输出就是作者编辑文章后生成博客文章页面供他人阅读。
这里有一个问题，即用户输入通常是不受控制的，它可能包含不正确的格式亦或者含有有安全隐患的代码；而最终网站输出的内容却必须是正确的HTML代码。这就需要对用户输入的内容进行纠错和过滤。

永远不要相信用户的输入
你可能会说：现在到处都是所见即所得的编辑器(WYSIWYG)，FCKeditor、TinyMCE...你可能会举出一大堆。是的，它们都可以自动生成标准的XHTML代码，但是作为web开发人员，你肯定听过"永远不要相信用户递交的数据"。

因此对用户输入数据进行纠错和过滤是必需的。

需要更好的纠错和过滤
目前为止我还没见过有让我满意的相关实现，能接触到的通常都是效率低下、效果不太理想，有这样那样的明显缺陷。举个比较知名的例子：WordPress是一种使用非常广泛的blog系统，操作简单功能强大且有丰富的插件支持，但是它集成的TinyMCE和后台一堆有些自作聪明的纠错过滤代码却令人相当头痛，对半角字符的强制替换，过于保守的替换规则等等.....导致像贴一段代码让它正确显示这种需求都很难做到。

这里顺便抱怨一下，这个blog是用WordPress架的，为了让这几篇文章能正确显示代码，网上搜了很多也试用了一些插件，最终还是翻了它的代码把一些过滤规则注释掉才勉强可以显示得体面一点 -.-b

当然，我不想过多的指责它(wordpress)，只是想说明它还可以做的更好。

Tidy是什么，它如何工作？
摘自Tidy ManPage的说明这样描述:

Tidy reads HTML, XHTML and XML files and writes cleaned up markup. For HTML variants, it detects and corrects many common coding errors and strives to produce visually equivalent markup that is both W3C compliant and works on most browsers. A common use of Tidy is to convert plain HTML to XHTML. For generic XML files, Tidy is limited to correcting basic well-formedness errors and pretty printing.

简单说Tidy是清理HTML代码的，生成干净的符合W3C标准的HTML代码，支持HTML,XHTML,XML。Tidy提供一个库TidyLib,以方便在其他应用中利用Tidy的强大功能。非常幸运，PHP有相应的tidy模块可以使用。

老兄，为什么又是PHP?
呃，这个问题... 惭愧，因为我只会那么点PHP而已 -.-v
不过还好，我这里讲的都不是纯粹的代码，好歹也有些分析的过程，分享这些东西比贴代码有用多了。

PHP中使用Tidy
要在PHP中使用Tidy需要安装Tidy模块，也就是加载tidy.so这个PHP extension，具体过程就略了，纯粹是体力活。最后能在phpinfo()中看到"Tidy support enabled" 就OK。

在这个模块的支持下，PHP中就可以使用Tidy提供的几乎所有的功能。常用的HTML清理是异常轻松的事情，甚至可以生成文档的解析树，像在客户端操作DOM那样的操作HTML的各个Node。下面将会有具体的代码说明，也可以看看PHP官方的相关手册。

纠错和过滤的PHP+Tidy实现
上面说了这么多背景素材，似乎太罗唆了，具体的解决问题的代码才最最直接。

1. 简单的纠错实现

function HtmlFix($html)
{

 if(!function_exists('tidy_repair_string'))
 return $html;
 //use tidy to repair html code

 //repair
 $str = tidy_repair_string($html,
 array('output-xhtml'=>true),
 'utf8');
 //parse
 $str = tidy_parse_string($str,
 array('output-xhtml'=>true),
 'utf8');
 $s = '';

 $nodes = @tidy_get_body($str)->child;

 if(!is_array($nodes)){
 $returnVal = 0;
 return $s;
 }

 foreach($nodes as $n){
 $s .= $n->value;
 }
 return $s;
}
上面的代码就是对可能不规范的XHTML代码进行清理纠错，输出标准的XHTML代码（输入输出都是UTF-8编码）。实现代码不是最精简的，因为为了配合下面的过滤功能，我写的尽可能细致了一些。

2. 高级实现: 纠错+过滤

功能：

XHTML的纠错，输出标准的XHTML代码。
过滤不安全的代码但是不影响内容展示，只是对style/javascript中不安全代码进行清除。
对超长字符串插入标记以实现浏览器兼容的自动换行功能，相关文章可参考网页中超长文字的断行问题。
function HtmlFixSafe($html)
{

 if(!function_exists('tidy_repair_string'))
 return $html;
 //use tidy to repair html code

 // tidy 的参数设定
 $conf = array(
 'output-xhtml'=>true
 ,'drop-empty-paras'=>FALSE
 ,'join-classes'=>TRUE
 ,'show-body-only'=>TRUE
 );

//repair
 $str = tidy_repair_string($html,$conf,'utf8');
 //生成解析树
 $str = tidy_parse_string($str,$conf,'utf8');

 $s ='';

 //得到body节点
 $body = @tidy_get_body($str);

 //函数 _dumpnode，检查每个节点，过滤后输出
 function _dumpnode($node,&$s){

 //查看节点名，如果是<script> 和<style>就直接清除 switch($node->name){ case 'script': case 'style': return; break; default: } if($node->type == TIDY_NODETYPE_TEXT){ /* 如果该节点内是文字，做额外的处理： 过长文字的自动换行问题; 超链接的自动识别(未实现) */ // insert $s .= HtmlInsertWbrs($node->value,30,'','&?/\'); // auto links ??? *** TODO *** return; } //不是文字节点，那么处理标签和它的属性 $s .= '<'.$node->name; //检查每个属性 if($node->attribute){ foreach($node->attribute as $name=>$value){ /* 清理一些DOM事件，通常是on开头的， 比如onclick onmouseover等.... 或者属性值有javascript:字样的， 比如href="javascript:"的也被清除. */ if(strpos($name,'on') === 0 stripos(trim($value),'javascript:') ===0 ){ continue; } //保留安全的属性 $s .= ' '.$name.'="'.HtmlEscape($value).'"'; } } //递归检查该节点下的子节点 if($node->child){ $s .= '>'; foreach($node->child as $child){ _dumpnode($child,$s); } //子节点处理完毕，闭合标签 $s .= '</'.$node->name.'>'; }else{ /* 已经没有子节点了，将标签闭合 (事实上也可以考虑直接删除掉空的节点) */ if($node->type == TIDY_NODETYPE_START) $s .= '></'.$node->name.'>'; else /* 对非配对标签，比如<hr/> <img / alt="PHP+Tidy－完美的XHTML纠错+过滤" >等 直接以 />闭合之 */ $s .= '/>'; } } //函数定义end //通过上面的函数对 body节点开始过滤。 if($body->child){ foreach($body->child as $child) _dumpnode($child,$s); }else return ''; return $s; } 上面代码中注释应该比较详细，工作原理就配合代码看吧。 更严格的过滤也很容易扩展，比如实现文中的链接自动识别。 一点补充 如果你看过我之前写的网页中超长文字的断行问题，你可能发现上面代码中处理自动换行的函数有所不同： 之前介绍的是HtmlEscapeInsertWbrs()，而上面使用的是HtmlInsertWbrs()。 这里要做一下解释： HtmlEscapeInsertWbrs()要求输入的字符串未作特殊字符转义的，也就是没有经过htmlspecialchars()对<>&等作<>&处理的。因为函数内部有专门的处理。 而在处理经Tidy处理过后的文字节点的时候，因为Tidy的关系，已经自动把<>&等字符作相应的<>&转义，因此需要用一个专门的函数避免重复的转义，这个函数就是HtmlInsertWbrs()，从名字上就知道它只插入标记，不做额外工作。 那么你可能有个问题： 如果被插入到HTML标签中间，比如在<div>或者>的中间插入了，变成<div>和&gt;，那就会影响到原始信息的展示。 没错，的确是个新问题，不过使用一些技巧就可以有效解决： 因为我们处理的是Tidy得到的文字节点，意味着不可能碰到HTML标签，因此不会碰到在标签中间插入的情况。 对于第二种情况，转义后的字符都是&xxxxx;这样的形式，那么只要在1所有&符号前面都插入标记就可以了（注意看调用时的第四个参数），因为下一个标记将会插在30(以上面代码中实际调用的第二个参数为例)个字符之后，这个已经2远远大于xxxxx的长度。这样由上面1、2两点可以保证不会插到转义字符的中间。 下面给出HtmlInsertWbrs()的PHP实现： function HtmlInsertWbrs($str, $n=10, $chars_to_break_after='',$chars_to_break_before='') { $out = ''; $strpos = 0; $spc = 0; $len = mb_strlen($str,'UTF-8'); for ($i = 1; $i < $len; ++$i) { $prev_char = mb_substr($str,$i-1,1,'UTF-8'); $next_char = mb_substr($str,$i,1,'UTF-8'); if (_u_IsSpace($next_char)) { $spc = $i; } else { if ($i - $spc == $n mb_strpos( $chars_to_break_after, $prev_char,0,'UTF-8' ) !== FALSE mb_strpos( $chars_to_break_before, $next_char,0,'UTF-8') !== FALSE ) { $out .= mb_substr($str,$strpos, $i-$strpos,'UTF-8') . ''; $strpos = $i; $spc = $i; } } } $out .= mb_substr($str,$strpos,$len-$strpos,'UTF-8'); return $out; } ... Ok,先写这么多，相关的资料在文中都有链接。 下次想到再补充。 </script>

Kenyataan Laman Web ini

Kandungan artikel ini disumbangkan secara sukarela oleh netizen, dan hak cipta adalah milik pengarang asal. Laman web ini tidak memikul tanggungjawab undang-undang yang sepadan. Jika anda menemui sebarang kandungan yang disyaki plagiarisme atau pelanggaran, sila hubungi admin@php.cn

Alat AI Hot

Undresser.AI Undress

Apl berkuasa AI untuk mencipta foto bogel yang realistik

AI Clothes Remover

Alat AI dalam talian untuk mengeluarkan pakaian daripada foto.

Undress AI Tool

Gambar buka pakaian secara percuma

Clothoff.io

Penyingkiran pakaian AI

Video Face Swap

Tukar muka dalam mana-mana video dengan mudah menggunakan alat tukar muka AI percuma kami!

Tunjukkan Lagi

Artikel Panas

Assassin's Creed Shadows: Penyelesaian Riddle Seashell

1 bulan yang lalu By DDD

Apa yang Baru di Windows 11 KB5054979 & Cara Memperbaiki Masalah Kemas Kini

3 minggu yang lalu By DDD

Di mana untuk mencari kad kunci kawalan kren di atomfall

1 bulan yang lalu By DDD

Bagaimana untuk memperbaiki KB5055523 gagal dipasang di Windows 11?

2 minggu yang lalu By DDD

Inzoi: Cara Memohon ke Sekolah dan Universiti

3 minggu yang lalu By DDD

Tunjukkan Lagi

Alat panas

Notepad++7.3.1

Editor kod yang mudah digunakan dan percuma

SublimeText3 versi Cina

Versi Cina, sangat mudah digunakan

Hantar Studio 13.0.1

Persekitaran pembangunan bersepadu PHP yang berkuasa

Dreamweaver CS6

Alat pembangunan web visual

SublimeText3 versi Mac

Perisian penyuntingan kod peringkat Tuhan (SublimeText3)

Tunjukkan Lagi

Topik panas

Di manakah pintu masuk log masuk untuk e-mel gmail?

7751

Tutorial Java

1643

Tutorial CakePHP

1398

Tutorial Laravel

1293

Tutorial PHP

1234

Tunjukkan Lagi

Related knowledge

Bagaimana untuk menggunakan akaun Xiaohongshu untuk mencari pengguna? Bolehkah saya mencari nombor telefon bimbit saya? Mar 22, 2024 am 08:40 AM

Dengan perkembangan pesat media sosial, Xiaohongshu telah menjadi salah satu platform sosial yang paling popular. Pengguna boleh membuat akaun Xiaohongshu untuk menunjukkan identiti peribadi mereka dan berkomunikasi serta berinteraksi dengan pengguna lain. Jika anda perlu mencari nombor Xiaohongshu pengguna, anda boleh mengikuti langkah mudah ini. 1. Bagaimana untuk menggunakan akaun Xiaohongshu untuk mencari pengguna? 1. Buka APP Xiaohongshu, klik butang "Temui" di penjuru kanan sebelah bawah, dan kemudian pilih pilihan "Nota". 2. Dalam senarai nota, cari nota yang disiarkan oleh pengguna yang ingin anda cari. Klik untuk memasuki halaman butiran nota. 3. Pada halaman butiran nota, klik butang "Ikuti" di bawah avatar pengguna untuk memasuki halaman utama peribadi pengguna. 4. Di penjuru kanan sebelah atas halaman utama peribadi pengguna, klik butang tiga titik dan pilih "Maklumat Peribadi"

Perbezaan antara vivox100s dan x100: perbandingan prestasi dan analisis fungsi Mar 23, 2024 pm 10:27 PM

Kedua-dua telefon bimbit vivox100s dan x100 adalah model yang mewakili dalam barisan produk telefon mudah alih vivo, masing-masing mewakili tahap teknologi canggih vivo dalam tempoh masa yang berbeza. Artikel ini akan menjalankan perbandingan terperinci antara kedua-dua telefon mudah alih ini dari segi perbandingan prestasi dan analisis fungsi untuk membantu pengguna memilih telefon mudah alih yang sesuai dengan mereka dengan lebih baik. Mula-mula, mari kita lihat perbandingan prestasi antara vivox100s dan x100. vivox100s dilengkapi dengan yang terbaru

Apakah sebenarnya media kendiri? Apakah ciri dan fungsi utamanya? Mar 21, 2024 pm 08:21 PM

Dengan perkembangan pesat Internet, konsep media kendiri telah berakar umbi dalam hati orang ramai. Jadi, apakah sebenarnya media kendiri? Apakah ciri dan fungsi utamanya? Seterusnya, kita akan meneroka isu-isu ini satu demi satu. 1. Apakah sebenarnya media kendiri? Kami-media, seperti namanya, bermakna anda adalah media. Ia merujuk kepada pembawa maklumat yang melaluinya individu atau pasukan boleh mencipta, mengedit, menerbitkan dan menyebarkan kandungan secara bebas melalui platform Internet. Berbeza dengan media tradisional, seperti akhbar, televisyen, radio, dan lain-lain, media kendiri lebih interaktif dan diperibadikan, membolehkan semua orang menjadi pengeluar dan penyebar maklumat. 2. Apakah ciri dan fungsi utama media kendiri? 1. Ambang rendah: Peningkatan media kendiri telah menurunkan ambang untuk memasuki industri media Peralatan yang rumit dan pasukan profesional tidak lagi diperlukan.

PHP digunakan untuk apa? Terokai peranan dan fungsi PHP Mar 24, 2024 am 11:39 AM

PHP ialah bahasa skrip bahagian pelayan yang digunakan secara meluas dalam pembangunan web Fungsi utamanya adalah untuk menjana kandungan web yang dinamik Apabila digabungkan dengan HTML, ia boleh mencipta halaman web yang kaya dan berwarna-warni. PHP berkuasa Ia boleh melaksanakan pelbagai operasi pangkalan data, operasi fail, pemprosesan borang dan tugas lain, menyediakan interaktiviti dan fungsi yang berkuasa untuk tapak web. Dalam artikel berikut, kami akan meneroka lebih lanjut peranan dan fungsi PHP, dengan contoh kod terperinci. Mula-mula, mari kita lihat penggunaan biasa PHP: penjanaan halaman web dinamik: P

Hasil Kumpulan Midea pada 2023 ialah 372 bilion yuan, peningkatan tahun ke tahun sebanyak 8.18%, dan dividen akan menjadi 20.8 bilion yuan Mar 28, 2024 pm 02:42 PM

Menurut berita dari laman web ini pada 28 Mac, Midea Group baru-baru ini mengumumkan bahawa ia akan mencapai pendapatan operasi sebanyak 372.037 bilion yuan pada tahun 2023, peningkatan tahun ke tahun sebanyak 8.18% yang boleh diagihkan kepada pemegang saham syarikat tersenarai ialah 33.72 bilion yuan; , peningkatan tahun ke tahun sebanyak 14.10% pendapatan asas sesaham ialah 4.93 yuan, peningkatan tahun ke tahun sebanyak 13.59%. Kumpulan Midea mengumumkan bahawa ia merancang untuk mengagihkan dividen tunai sebanyak 30 yuan bagi setiap 10 saham Jumlah keseluruhan dividen ini ialah 20.8 bilion yuan, menyumbang lebih daripada 61.5% daripada keuntungan bersih yang boleh diagihkan kepada syarikat induk, yang merupakan yang tertinggi. nisbah dividen dalam sejarah. Pada 2023, data laporan kewangan menunjukkan bahawa tiga hasil perniagaan ToB utama Midea bagi tenaga baharu dan teknologi perindustrian, robotik dan automasi serta teknologi strategi bangunan pintar ialah 27.9 bilion yuan (peningkatan tahun ke tahun sebanyak 29%) dan 31.1 bilion yuan (peningkatan tahun ke tahun) masing-masing.

Memahami VSCode: Untuk apa alat ini digunakan? Mar 25, 2024 pm 03:06 PM

"Memahami VSCode: Untuk apa alat ini digunakan?" 》Sebagai pengaturcara, sama ada anda seorang pemula atau pembangun berpengalaman, anda tidak boleh melakukannya tanpa menggunakan alat penyuntingan kod. Di antara banyak alat penyuntingan, Kod Visual Studio (pendek kata VSCode) sangat popular di kalangan pembangun sebagai penyunting kod sumber terbuka, ringan dan berkuasa. Jadi, untuk apa sebenarnya VSCode digunakan? Artikel ini akan menyelidiki fungsi dan kegunaan VSCode dan menyediakan contoh kod khusus untuk membantu pembaca

Apakah kegunaan aplikasi mudah alih dan Jiaqin? Mar 27, 2024 pm 09:01 PM

APP Mudah Alih Hejiaqin ialah perisian komprehensif yang menyepadukan pengurusan keluarga, kawalan pintar dan komunikasi keluarga. Ia bertujuan untuk mewujudkan persekitaran rumah yang selesa, pintar dan harmoni untuk pengguna melalui operasi pintar dan mudah. Melalui aplikasi ini, pengguna boleh mengawal dan mengurus pelbagai peranti pintar dengan mudah di rumah serta menikmati kemudahan yang dibawa oleh kehidupan pintar. Jadi apakah fungsi khusus Aplikasi Mudah Alih dan Jiaqin Pengguna yang ingin mengetahui lebih lanjut mengenainya boleh mengikuti artikel ini untuk mengetahui lebih lanjut mengenainya! Tutorial tentang cara menggunakan aplikasi Mudah Alih dan Jiaqin: Apakah kegunaan aplikasi Mudah Alih dan Jiaqin Walaupun anda tidak tahu IT, anda boleh menguruskan rangkaian dengan mudah 2. Tidak kira berapa banyak produk pintar yang anda ada app sudah cukup. 3. Walaupun anda berada beribu-ribu batu dari rumah, anda masih boleh "pulang" untuk menontonnya

Apakah mata wang GateToken(GT)? Pengenalan kepada fungsi syiling GT dan ekonomi token Jul 15, 2024 pm 04:36 PM

Apakah mata wang GateToken(GT)? GT (GateToken) ialah aset asli pada rantaian GateChain dan mata wang platform rasmi Gate.io. Nilai syiling GT berkait rapat dengan pembangunan ekologi Gate.io dan GateChain. Apakah GateChain? GateChain dilahirkan pada 2018 dan merupakan generasi baharu rangkaian awam berprestasi tinggi yang dilancarkan oleh Gate.io. GateChain menumpukan pada melindungi keselamatan aset dalam rantaian pengguna dan menyediakan perkhidmatan transaksi terdesentralisasi yang mudah. Matlamat GateChain adalah untuk membina ekosistem penyimpanan, pengedaran dan transaksi aset digital terdesentralisasi yang selamat dan cekap peringkat perusahaan. Gatechain mempunyai asal

See all articles