目录
回复内容:
首页 后端开发 php教程 如何解析300M+的XML文件?

如何解析300M+的XML文件?

Jun 06, 2016 pm 08:35 PM
php xml

背景:
1、手上有几个大的xml文件,基本都在300M至600M之间;
2、XML内容包括title,co-author,abstract,Affiliation等;
3、用的是xmlreader进行解析;

遇到的问题:
如果解析所有内容,经常只能把XML文件的一部分解析出来,似乎是内存不够的迹象;
如果只把title或Affiliation单独解析出来,就能全部解析XML文件;

附上代码:

<code>set_time_limit(0);
header("Content-Type: text/html;charset=utf-8");
$num=0;
$reader = new XMLReader();
$reader-&gt;open("JACS.xml");
while ($reader-&gt;read()) {

    if($reader-&gt;nodeType==XMLREADER::ELEMENT) {
             if ($reader-&gt;localName == "PubmedArticle") {
                  $num++;
                  echo 'Number:'.$num;
                    while ($reader-&gt;read()) {
                       if ($reader-&gt;nodeType == XMLREADER::ELEMENT) {
                                if ($reader-&gt;localName == "PubDate") {
                                     while ($reader-&gt;read()){
                                         if ($reader-&gt;nodeType == XMLREADER::ELEMENT) {
                                               if ($reader-&gt;localName == "Year") {
                                                   $reader-&gt;read();
                                                   echo 'PublicationDate:'.$reader-&gt;value.' ';
                                                   break;
                                               }

                                         }
                                     }
                                     while ($reader-&gt;read()){
                                         if ($reader-&gt;nodeType == XMLREADER::ELEMENT) {
                                               if ($reader-&gt;localName == "Month") {
                                                   $reader-&gt;read();
                                                   echo $reader-&gt;value.' ';
                                                   break;
                                               }

                                         }
                                     }
                                     while ($reader-&gt;read()){
                                         if ($reader-&gt;nodeType == XMLREADER::ELEMENT) {
                                               if ($reader-&gt;localName == "Day") {
                                                   $reader-&gt;read();
                                                   echo $reader-&gt;value;
                                                   break;
                                               }

                                         }
                                     }
                                     echo '<br>';
                                     break;
                                   }

                            }
                        }

                    while ($reader-&gt;read()) {
                       if ($reader-&gt;nodeType == XMLREADER::ELEMENT) {
                                if ($reader-&gt;localName == "Title") {
                                    $reader-&gt;read();
                                    echo 'JournalName:'.$reader-&gt;value.'<br>';
                                    break;
                                }

                       }
                    }

                    while ($reader-&gt;read()) {
                       if ($reader-&gt;nodeType == XMLREADER::ELEMENT) {
                                if ($reader-&gt;localName == "ArticleTitle") {
                                    $reader-&gt;read();
                                    echo 'ArticleTitle:'.$reader-&gt;value.'<br>';
                                    break;
                                }

                       }
                    }

                    while ($reader-&gt;read()) {
                       if ($reader-&gt;nodeType == XMLREADER::ELEMENT) {
                                if ($reader-&gt;localName == "AbstractText") {
                                    $reader-&gt;read();
                                    echo 'Abstract:'.$reader-&gt;value.'<br><br>';
                                    break;
                                }

                       }
                    }




                    while ($reader-&gt;read()) {
                       if ($reader-&gt;nodeType == XMLREADER::ELEMENT) {
                                if ($reader-&gt;localName == "Affiliation") {
                                    $reader-&gt;read();
                                    echo 'Affiliation:'.$reader-&gt;value.'<br><br>';
                                    break;
                                }

                       }
                    }

                  }
                }
            }
    $reader-&gt;close();
}
</code>
登录后复制
登录后复制

回复内容:

背景:
1、手上有几个大的xml文件,基本都在300M至600M之间;
2、XML内容包括title,co-author,abstract,Affiliation等;
3、用的是xmlreader进行解析;

遇到的问题:
如果解析所有内容,经常只能把XML文件的一部分解析出来,似乎是内存不够的迹象;
如果只把title或Affiliation单独解析出来,就能全部解析XML文件;

附上代码:

<code>set_time_limit(0);
header("Content-Type: text/html;charset=utf-8");
$num=0;
$reader = new XMLReader();
$reader-&gt;open("JACS.xml");
while ($reader-&gt;read()) {

    if($reader-&gt;nodeType==XMLREADER::ELEMENT) {
             if ($reader-&gt;localName == "PubmedArticle") {
                  $num++;
                  echo 'Number:'.$num;
                    while ($reader-&gt;read()) {
                       if ($reader-&gt;nodeType == XMLREADER::ELEMENT) {
                                if ($reader-&gt;localName == "PubDate") {
                                     while ($reader-&gt;read()){
                                         if ($reader-&gt;nodeType == XMLREADER::ELEMENT) {
                                               if ($reader-&gt;localName == "Year") {
                                                   $reader-&gt;read();
                                                   echo 'PublicationDate:'.$reader-&gt;value.' ';
                                                   break;
                                               }

                                         }
                                     }
                                     while ($reader-&gt;read()){
                                         if ($reader-&gt;nodeType == XMLREADER::ELEMENT) {
                                               if ($reader-&gt;localName == "Month") {
                                                   $reader-&gt;read();
                                                   echo $reader-&gt;value.' ';
                                                   break;
                                               }

                                         }
                                     }
                                     while ($reader-&gt;read()){
                                         if ($reader-&gt;nodeType == XMLREADER::ELEMENT) {
                                               if ($reader-&gt;localName == "Day") {
                                                   $reader-&gt;read();
                                                   echo $reader-&gt;value;
                                                   break;
                                               }

                                         }
                                     }
                                     echo '<br>';
                                     break;
                                   }

                            }
                        }

                    while ($reader-&gt;read()) {
                       if ($reader-&gt;nodeType == XMLREADER::ELEMENT) {
                                if ($reader-&gt;localName == "Title") {
                                    $reader-&gt;read();
                                    echo 'JournalName:'.$reader-&gt;value.'<br>';
                                    break;
                                }

                       }
                    }

                    while ($reader-&gt;read()) {
                       if ($reader-&gt;nodeType == XMLREADER::ELEMENT) {
                                if ($reader-&gt;localName == "ArticleTitle") {
                                    $reader-&gt;read();
                                    echo 'ArticleTitle:'.$reader-&gt;value.'<br>';
                                    break;
                                }

                       }
                    }

                    while ($reader-&gt;read()) {
                       if ($reader-&gt;nodeType == XMLREADER::ELEMENT) {
                                if ($reader-&gt;localName == "AbstractText") {
                                    $reader-&gt;read();
                                    echo 'Abstract:'.$reader-&gt;value.'<br><br>';
                                    break;
                                }

                       }
                    }




                    while ($reader-&gt;read()) {
                       if ($reader-&gt;nodeType == XMLREADER::ELEMENT) {
                                if ($reader-&gt;localName == "Affiliation") {
                                    $reader-&gt;read();
                                    echo 'Affiliation:'.$reader-&gt;value.'<br><br>';
                                    break;
                                }

                       }
                    }

                  }
                }
            }
    $reader-&gt;close();
}
</code>
登录后复制
登录后复制

可以参考一下 这个 PHP处理比较大的XML文件

为啥要装那么大 txt打开那么大也死机了 多分几个文件吧

本站声明
本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

热门文章

仓库:如何复兴队友
3 周前 By 尊渡假赌尊渡假赌尊渡假赌
Hello Kitty Island冒险:如何获得巨型种子
3 周前 By 尊渡假赌尊渡假赌尊渡假赌
两个点博物馆:所有展览以及在哪里可以找到它们
3 周前 By 尊渡假赌尊渡假赌尊渡假赌

热门文章

仓库:如何复兴队友
3 周前 By 尊渡假赌尊渡假赌尊渡假赌
Hello Kitty Island冒险:如何获得巨型种子
3 周前 By 尊渡假赌尊渡假赌尊渡假赌
两个点博物馆:所有展览以及在哪里可以找到它们
3 周前 By 尊渡假赌尊渡假赌尊渡假赌

热门文章标签

记事本++7.3.1

记事本++7.3.1

好用且免费的代码编辑器

SublimeText3汉化版

SublimeText3汉化版

中文版,非常好用

禅工作室 13.0.1

禅工作室 13.0.1

功能强大的PHP集成开发环境

Dreamweaver CS6

Dreamweaver CS6

视觉化网页开发工具

SublimeText3 Mac版

SublimeText3 Mac版

神级代码编辑软件(SublimeText3)

CakePHP 日期和时间 CakePHP 日期和时间 Sep 10, 2024 pm 05:27 PM

CakePHP 日期和时间

适用于 Ubuntu 和 Debian 的 PHP 8.4 安装和升级指南 适用于 Ubuntu 和 Debian 的 PHP 8.4 安装和升级指南 Dec 24, 2024 pm 04:42 PM

适用于 Ubuntu 和 Debian 的 PHP 8.4 安装和升级指南

CakePHP 文件上传 CakePHP 文件上传 Sep 10, 2024 pm 05:27 PM

CakePHP 文件上传

CakePHP 路由 CakePHP 路由 Sep 10, 2024 pm 05:25 PM

CakePHP 路由

讨论 CakePHP 讨论 CakePHP Sep 10, 2024 pm 05:28 PM

讨论 CakePHP

CakePHP 项目配置 CakePHP 项目配置 Sep 10, 2024 pm 05:25 PM

CakePHP 项目配置

CakePHP 快速指南 CakePHP 快速指南 Sep 10, 2024 pm 05:27 PM

CakePHP 快速指南

如何设置 Visual Studio Code (VS Code) 进行 PHP 开发 如何设置 Visual Studio Code (VS Code) 进行 PHP 开发 Dec 20, 2024 am 11:31 AM

如何设置 Visual Studio Code (VS Code) 进行 PHP 开发

See all articles