Python을 사용하여 사이트맵을 생성하는 방법에 대한 자세한 소개

웹사이트 프로젝트 작업을 할 때 스크립트는 크롤러에게 편리하고 SEO에 도움이 되는 사이트맵을 생성하는 데 자주 사용됩니다. 그렇다면 Python을 사용하여 사이트맵을 생성하는 방법은 무엇입니까? 아래에서 공부해보자.

Install lxml

먼저 lxml 라이브러리를 설치하려면 pip install lxml이 필요합니다.

우분투에서 다음 오류가 발생하는 경우:

#include "libxml/xmlversion.h"
compilation terminated.
error: command 'x86_64-linux-gnu-gcc' failed with exit status 1
Cleaning up...
 Removing temporary dir /tmp/pip_build_root...
Command /usr/bin/python -c "import setuptools, tokenize;__file__='/tmp/pip_build_root/lxml/';exec(compile(getattr(tokenize, 'open', open)(__file__).read().replace('\r\n', '\n'), __file__, 'exec'))" install --record /tmp/pip-O4cIn6-record/install-record.txt --single-version-externally-managed --compile failed with error code 1 in /tmp/pip_build_root/lxml
Exception information:
Traceback (most recent call last):
 File "/usr/lib/python2.7/dist-packages/pip/", line 122, in main
  status =, args)
 File "/usr/lib/python2.7/dist-packages/pip/commands/", line 283, in run
  requirement_set.install(install_options, global_options, root=options.root_path)
 File "/usr/lib/python2.7/dist-packages/pip/", line 1435, in install
  requirement.install(install_options, global_options, *args, **kwargs)
 File "/usr/lib/python2.7/dist-packages/pip/", line 706, in install
  cwd=self.source_dir, filter_stdout=self._filter_install, show_stdout=False)
 File "/usr/lib/python2.7/dist-packages/pip/", line 697, in call_subprocess
  % (command_desc, proc.returncode, cwd))
InstallationError: Command /usr/bin/python -c "import setuptools, tokenize;__file__='/tmp/pip_build_root/lxml/';exec(compile(getattr(tokenize, 'open', open)(__file__).read().replace('\r\n', '\n'), __file__, 'exec'))" install --record /tmp/pip-O4cIn6-record/install-record.txt --single-version-externally-managed --compile failed with error code 1 in /tmp/pip_build_root/lxml
다음 종속성을 설치하세요.

sudo apt-get install libxml2-dev libxslt1-dev
Python 코드

다음은 사이트맵 및 사이트맵 인덱스 색인을 생성하는 코드입니다. 필수 매개변수를 전달하거나 다음과 같이 필드를 추가할 수 있습니다. 필수:

#!/usr/bin/env python
# -*- coding:utf-8 -*-
import io
import re
from lxml import etree
def generate_xml(filename, url_list):
  """Generate a new xml file use url_list"""
  root = etree.Element('urlset',
  for each in url_list:
    url = etree.Element('url')
    loc = etree.Element('loc')
    loc.text = each
  header = u&#39;<?xml version="1.0" encoding="UTF-8"?>\n&#39;
  s = etree.tostring(root, encoding=&#39;utf-8&#39;, pretty_print=True)
  with, &#39;w&#39;, encoding=&#39;utf-8&#39;) as f:
def update_xml(filename, url_list):
  """Add new url_list to origin xml file."""
  f = open(filename, &#39;r&#39;)
  lines = [i.strip() for i in f.readlines()]
  old_url_list = []
  for each_line in lines:
    d = re.findall(&#39;<loc>(http:\/\/.+)<\/loc>&#39;, each_line)
    old_url_list += d
  url_list += old_url_list
  generate_xml(filename, url_list)
def generatr_xml_index(filename, sitemap_list, lastmod_list):
  """Generate sitemap index xml file."""
  root = etree.Element(&#39;sitemapindex&#39;,
  for each_sitemap, each_lastmod in zip(sitemap_list, lastmod_list):
    sitemap = etree.Element(&#39;sitemap&#39;)
    loc = etree.Element(&#39;loc&#39;)
    loc.text = each_sitemap
    lastmod = etree.Element(&#39;lastmod&#39;)
    lastmod.text = each_lastmod
  header = u&#39;<?xml version="1.0" encoding="UTF-8"?>\n&#39;
  s = etree.tostring(root, encoding=&#39;utf-8&#39;, pretty_print=True)
  with, &#39;w&#39;, encoding=&#39;utf-8&#39;) as f:
if __name__ == &#39;__main__&#39;:
  urls = [&#39;;] * 10
  mods = [&#39;2004-10-01T18:23:17+00:00&#39;] * 10
  generatr_xml_index(&#39;index.xml&#39;, urls, mods)
생성된 효과는 다음 형식이어야 합니다.

사이트맵 형식:

<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="">
<?xml version="1.0" encoding="UTF-8"?>
  <sitemapindex xmlns="">
lastmod 시간 형식 문제

형식은 ISO 8601 표준을 사용합니다.

def get_lastmod_time(filename):
  time_stamp = os.path.getmtime(filename)
  t = time.localtime(time_stamp)
  # return time.strftime(&#39;%Y-%m-%dT%H:%M:%S+08:00&#39;, t)
  return time.strftime(&#39;%Y-%m-%dT%H:%M:%SZ&#39;, t)
일반적으로 lxml을 사용하는 것은 비효율적이며 많은 메모리를 차지합니다. 파일의 쓰기 방법을 사용하여 직접 생성할 수 있습니다.


