Beautiful Soup モジュールが Python でオブジェクトを作成する方法の概要-Python チュートリアル-php.cn

ホームページ

バックエンド開発

Python チュートリアル

Beautiful Soup モジュールが Python でオブジェクトを作成する方法の概要

Y2J

Apr 22, 2017 am 09:45 AM

beautiful soup python オブジェクトの作成

この記事では主に、Beautiful Soup モジュールを使用してオブジェクトを作成するための関連情報を紹介します。必要な方はぜひ参考にしてください。

インストール

pip 経由で Beautiful Soup モジュールをインストールします: pip install beautifulsoup4 。

PyCharm IDE を使用してコードを記述することもできます。PyCharm の設定でプロジェクトを見つけ、その中で Beautiful Soup モジュールを検索してインストールします。

BeautifulSoup オブジェクトを作成する

Beautiful Soup モジュールは、Web ページからデータを取得するために広く使用されています。 Beautiful Soup モジュールを使用すると、HTML/XML ドキュメントからあらゆるデータ (Web ページ内のすべてのリンクやタグ内のコンテンツなど) を抽出できます。

これを実現するために、Beautiful Soup はさまざまなオブジェクトとメソッドを提供します。あらゆる HTML/XML ドキュメントをさまざまな Beautiful Soup オブジェクトに変換でき、これらのオブジェクトにはさまざまなプロパティとメソッドがあり、そこから必要なデータを抽出できます。

Beautiful Soup には合計 3 つのオブジェクトがあります:

BeautifulSoup
Tag
NavigableString

BeautifulSoup オブジェクトを作成します

BeautifulSoup オブジェクトの作成は、あらゆる作業の開始点です。美しいスーププロジェクト。

BeautifulSoup は、マシン上のファイルや Web ページなどの文字列またはファイルのようなオブジェクトを渡すことができます。

文字列から BeautifulSoup オブジェクトを作成する

BeautifulSoup のコンストラクターに文字列を渡してオブジェクトを作成します。

helloworld = &#39;<p>Hello World</p>&#39;
soup_string = BeautifulSoup(helloworld)
print soup_string 
<html><body><p>Hello World</p></body></html>

ログイン後にコピー

ファイル様オブジェクトから BeautifulSoup オブジェクトを作成する

BeautifulSoup のコンストラクターにファイル様オブジェクトを渡すことでオブジェクトを作成します。これは、オンライン Web ページを解析するときに非常に便利です。

url = "http://www.glumes.com"
page = urllib2.urlopen(url)
soup = BeautifulSoup(page)
print soup

ログイン後にコピー

ファイルのようなオブジェクトを渡すことに加えて、ローカルファイルオブジェクトを BeautifulSoup のコンストラクターに渡してオブジェクトを生成することもできます。

with open(&#39;foo.html&#39;,&#39;r&#39;) as foo_file :
 soup_foo = BeautifulSoup(foo_file)
print soup_foo

ログイン後にコピー

XML 解析用の BeautifulSoup オブジェクトを作成する

Beautiful Soup モジュールは XML の解析にも使用できます。

BeautifulSoup オブジェクトを作成するとき、Beautiful Soup モジュールは適切な TreeBuilder クラスを選択して HTML/XML ツリーを作成します。デフォルトでは、HTML TreeBuilder オブジェクトが選択されており、デフォルトの HTML パーサーを使用して HTML 構造ツリーを生成します。上記のコードでは、文字列を HTML ツリー構造に解析することによって、BeautifulSoup オブジェクトが生成されます。

Beautiful Soup モジュールで入力コンテンツを XML 型に解析したい場合は、Beautiful Soup コンストラクターで使用される features パラメーターを正確に指定する必要があります。 features パラメーターを指定すると、Beautiful Soup は必要な機能を満たす最も適切な TreeBuilder クラスを選択します。

機能パラメーターを理解する

すべての TreeBuilder には、使用するパーサーに基づいて異なる機能があります。したがって、入力コンテンツは、コンストラクターに渡される features パラメーターに応じて異なる結果になります。
Beautiful Soup モジュールで、現在 TreeBuilder によって使用されているパーサーは次のとおりです:

lxml
html5lib
html.parser

BeautifulSoup コンストラクターの features パラメーターは、次のリストを受け入れることができます。文字列または文字列値。

現在、各 TreeBuilder でサポートされている機能パラメーターとパーサーは次の表のとおりです。 fast '、'許容 ']

lxmltreebuilderlxml[' html '、' html5lib '、'容認 '、' strict '、' html5 ']html5treebuilderhtml5lib[' '' '' '' ' html ' ,'strict','html.parser']HTMLParserTreeBuilderhtml.parser['xml','lxml','permissive','fast']LXMLTreeBuilderForXMLlxml

根据指定的 feature 参数，Beautiful Soup 将会选择最合适的 TreeBuilder 类。如果在指定对应的解析器时，出现如下的报错信息，可能就是需要安装对应的解析器了。

bs4.FeatureNotFound: Couldn&#39;t find a tree builder with the features you requested: html5lib. 
Do you need to install a parser library?

ログイン後にコピー

就 HTML 文档而言，选择 TreeBuilder 的顺序是基于解析器建立的优先级，就如上表格所示的优先级。首先是 lxml ，其次是 html5lib ，最后才是 html.parser 。例如，我们选择 html 字符串作为 feature 参数，那么如果 lxml 解析器可用，则 Beautiful Soup 模块将会选择 LXMLTreeBuilder 。如果 lxml 不可用，则会选择根据 html5lib 解析器选择 HTML5TreeBuilder 。如果在不可用，则会选择根据 html.parser 选择 HTMLParserTreeBuilder 了。

至于 XML ，由于 lxml 是唯一的解析器，所以 LXMLTreeBuilderForXML 总是会被选择的。

所以，为 XML 创建一个 Beautiful Soup 对象的代码如下：

helloworld = &#39;<p>Hello World</p>&#39;
soup_string = BeautifulSoup(helloworld,features="xml")
print soup_string

ログイン後にコピー

输入的结果也是 XML 形式的文件：

在创建 Beautiful Soup 对象时，更好的实践是指定解析器。这是因为，不同的解析器解析的结果内容大不相同，尤其是在我们的 HTML 文档内容非法时，结果更为明显。

当我们创建一个 BeautifulSoup 对象时，Tag 和 NavigableString 对象也就创建了。

创建 Tag 对象

我们可以从 BeautifulSoup 对象中得到 Tag 对象，也就是 HTML/XML 中的标签。

如下 HTML 代码所示：

#!/usr/bin/python
# -*- coding:utf-8 -*-
from bs4 import BeautifulSoup
html_atag = """
 <html>
 <body>
 <p>Test html a tag example</p>
 <a href="http://www.glumes.com&#39;>Home</a>
 <a href="http;//www.glumes.com/index.html&#39;>Blog</a>
 </body>
 <html>
 """
soup = BeautifulSoup(html_atag,&#39;html.parser&#39;)
atag = soup.a
print type(atag)
print atag

ログイン後にコピー

从结果中可以看到 atag 的类型是。而 soup.a 的结果就是 HTML 文档中的第一个标签。
HTML/XML 标签对象具有名称和属性。名称就是标签的名字，例如标签的名称就是 a 。属性则是标签的 class 、id 、style 等。Tag 对象允许我们得到 HTML 标签的名称和属性。

Tag 对象的名称

通过 .name 方式得到 Tag 对象的名称。

tagname = atag.name
print tagname

ログイン後にコピー

同时也能够改变 Tag 对象的名称：

atag.name = &#39;p&#39;

ログイン後にコピー

这样就将上面 HTML 文档中的第一个标签名称换成了

标签了。

Tag 对象的属性

在 HTML 页面中，标签可能有不同的属性，例如 class 、id 、style 等。Tag 对象能够以字典的形式访问标签的属性。

atag = soup_atag.a
print atag

ログイン後にコピー

也能通过 .attrs 的方式访问到，这样会将所有的属性内容都打印出来：

print atag.attrs
{&#39;href&#39;: u&#39;http://www.glumes.com&#39;}

ログイン後にコピー

创建 NavigableString 对象

NavigableString 对象持有 HTML 或 XML 标签的文本内容。这是一个 Unicode 编码的字符串。

我们可以通过 .string 的方式得到标签的本文内容。

navi = atag.string
print type(navi)
print navi.string

soup = BeautifulSoup(String)

soup = BeautifulSoup(String,features=”xml”)

Tag

tag = soup.tag

tag.name

tag[‘attribute']

NavigableString

soup.tag.string

总结

以上がBeautiful Soup モジュールが Python でオブジェクトを作成する方法の概要の詳細内容です。詳細については、PHP 中国語 Web サイトの他の関連記事を参照してください。

このウェブサイトの声明

この記事の内容はネチズンが自主的に寄稿したものであり、著作権は原著者に帰属します。このサイトは、それに相当する法的責任を負いません。盗作または侵害の疑いのあるコンテンツを見つけた場合は、admin@php.cn までご連絡ください。

ホットAIツール

Undresser.AI Undress

リアルなヌード写真を作成する AI 搭載アプリ

AI Clothes Remover

写真から衣服を削除するオンライン AI ツール。

Undress AI Tool

脱衣画像を無料で

Clothoff.io

AI衣類リムーバー

AI Hentai Generator

AIヘンタイを無料で生成します。

ホットツール

メモ帳++7.3.1

使いやすく無料のコードエディター

SublimeText3 中国語版

中国語版、とても使いやすい

ゼンドスタジオ 13.0.1

強力な PHP 統合開発環境

ドリームウィーバー CS6

ビジュアル Web 開発ツール

SublimeText3 Mac版

神レベルのコード編集ソフト（SublimeText3）

ホットトピック

Gmailメールのログイン入り口はどこですか？

7471

CakePHP チュートリアル

1377

Steamのアカウント名の形式は何ですか

Win11 Activation Key Permanent

NYTの接続はヒントと回答です

Related knowledge

mysqlは支払う必要がありますか Apr 08, 2025 pm 05:36 PM

MySQLには、無料のコミュニティバージョンと有料エンタープライズバージョンがあります。コミュニティバージョンは無料で使用および変更できますが、サポートは制限されており、安定性要件が低く、技術的な能力が強いアプリケーションに適しています。 Enterprise Editionは、安定した信頼性の高い高性能データベースを必要とするアプリケーションに対する包括的な商業サポートを提供し、サポートの支払いを喜んでいます。バージョンを選択する際に考慮される要因には、アプリケーションの重要性、予算編成、技術スキルが含まれます。完璧なオプションはなく、最も適切なオプションのみであり、特定の状況に応じて慎重に選択する必要があります。

インストール後にMySQLの使用方法 Apr 08, 2025 am 11:48 AM

この記事では、MySQLデータベースの操作を紹介します。まず、MySQLWorkBenchやコマンドラインクライアントなど、MySQLクライアントをインストールする必要があります。 1. mysql-uroot-pコマンドを使用してサーバーに接続し、ルートアカウントパスワードでログインします。 2。CreatedAtaBaseを使用してデータベースを作成し、データベースを選択します。 3. createTableを使用してテーブルを作成し、フィールドとデータ型を定義します。 4. INSERTINTOを使用してデータを挿入し、データをクエリし、更新することでデータを更新し、削除してデータを削除します。これらの手順を習得することによってのみ、一般的な問題に対処することを学び、データベースのパフォーマンスを最適化することでMySQLを効率的に使用できます。

MySQLはダウンロード後にインストールできません Apr 08, 2025 am 11:24 AM

MySQLのインストール障害の主な理由は次のとおりです。1。許可の問題、管理者として実行するか、SUDOコマンドを使用する必要があります。 2。依存関係が欠落しており、関連する開発パッケージをインストールする必要があります。 3.ポート競合では、ポート3306を占めるプログラムを閉じるか、構成ファイルを変更する必要があります。 4.インストールパッケージが破損しているため、整合性をダウンロードして検証する必要があります。 5.環境変数は誤って構成されており、環境変数はオペレーティングシステムに従って正しく構成する必要があります。これらの問題を解決し、各ステップを慎重に確認して、MySQLを正常にインストールします。

MySQLダウンロードファイルが破損しており、インストールできません。修復ソリューション Apr 08, 2025 am 11:21 AM

mysqlダウンロードファイルは破損していますが、どうすればよいですか？残念ながら、MySQLをダウンロードすると、ファイルの破損に遭遇できます。最近は本当に簡単ではありません！この記事では、誰もが迂回を避けることができるように、この問題を解決する方法について説明します。それを読んだ後、損傷したMySQLインストールパッケージを修復するだけでなく、将来の行き詰まりを避けるために、ダウンロードとインストールプロセスをより深く理解することもできます。最初に、ファイルのダウンロードが破損した理由について話しましょう。これには多くの理由があります。ネットワークの問題は犯人です。ダウンロードプロセスの中断とネットワーク内の不安定性は、ファイル腐敗につながる可能性があります。ダウンロードソース自体にも問題があります。サーバーファイル自体が壊れており、もちろんダウンロードすると壊れています。さらに、いくつかのウイルス対策ソフトウェアの過度の「情熱的な」スキャンもファイルの破損を引き起こす可能性があります。診断問題：ファイルが本当に破損しているかどうかを判断します

MySQLインストール後に開始できないサービスのソリューション Apr 08, 2025 am 11:18 AM

MySQLは開始を拒否しましたか？パニックにならないでください、チェックしてみましょう！多くの友人は、MySQLのインストール後にサービスを開始できないことを発見し、彼らはとても不安でした！心配しないでください、この記事はあなたがそれを落ち着いて対処し、その背後にある首謀者を見つけるためにあなたを連れて行きます！それを読んだ後、あなたはこの問題を解決するだけでなく、MySQLサービスの理解と問題のトラブルシューティングのためのあなたのアイデアを改善し、より強力なデータベース管理者になることができます！ MySQLサービスは開始に失敗し、単純な構成エラーから複雑なシステムの問題に至るまで、多くの理由があります。最も一般的な側面から始めましょう。基本知識：サービススタートアッププロセスMYSQLサービススタートアップの簡単な説明。簡単に言えば、オペレーティングシステムはMySQL関連のファイルをロードし、MySQLデーモンを起動します。これには構成が含まれます

mysqlはインターネットが必要ですか？ Apr 08, 2025 pm 02:18 PM

MySQLは、基本的なデータストレージと管理のためにネットワーク接続なしで実行できます。ただし、他のシステムとのやり取り、リモートアクセス、または複製やクラスタリングなどの高度な機能を使用するには、ネットワーク接続が必要です。さらに、セキュリティ対策（ファイアウォールなど）、パフォーマンスの最適化（適切なネットワーク接続を選択）、およびデータバックアップは、インターネットに接続するために重要です。

高負荷アプリケーションのMySQLパフォーマンスを最適化する方法は？ Apr 08, 2025 pm 06:03 PM

MySQLデータベースパフォーマンス最適化ガイドリソース集約型アプリケーションでは、MySQLデータベースが重要な役割を果たし、大規模なトランザクションの管理を担当しています。ただし、アプリケーションのスケールが拡大すると、データベースパフォーマンスのボトルネックが制約になることがよくあります。この記事では、一連の効果的なMySQLパフォーマンス最適化戦略を検討して、アプリケーションが高負荷の下で効率的で応答性の高いままであることを保証します。実際のケースを組み合わせて、インデックス作成、クエリ最適化、データベース設計、キャッシュなどの詳細な主要なテクノロジーを説明します。 1.データベースアーキテクチャの設計と最適化されたデータベースアーキテクチャは、MySQLパフォーマンスの最適化の基礎です。いくつかのコア原則は次のとおりです。適切なデータ型を選択し、ニーズを満たす最小のデータ型を選択すると、ストレージスペースを節約するだけでなく、データ処理速度を向上させることもできます。

MySQLインストール後にデータベースのパフォーマンスを最適化する方法 Apr 08, 2025 am 11:36 AM

MySQLパフォーマンスの最適化は、インストール構成、インデックス作成、クエリの最適化、監視、チューニングの3つの側面から開始する必要があります。 1。インストール後、INNODB_BUFFER_POOL_SIZEパラメーターやclose query_cache_sizeなど、サーバーの構成に従ってmy.cnfファイルを調整する必要があります。 2。過度のインデックスを回避するための適切なインデックスを作成し、説明コマンドを使用して実行計画を分析するなど、クエリステートメントを最適化します。 3. MySQL独自の監視ツール（ShowProcessList、ShowStatus）を使用して、データベースの健康を監視し、定期的にデータベースをバックアップして整理します。これらの手順を継続的に最適化することによってのみ、MySQLデータベースのパフォーマンスを改善できます。

See all articles

Beautiful Soup モジュールが Python でオブジェクトを作成する方法の概要

ホットAIツール

Undresser.AI Undress

AI Clothes Remover

Undress AI Tool

Clothoff.io

AI Hentai Generator

人気の記事

ホットツール

メモ帳++7.3.1

SublimeText3 中国語版

ゼンドスタジオ 13.0.1

ドリームウィーバー CS6

SublimeText3 Mac版

ホットトピック