Heim > Backend-Entwicklung > Python-Tutorial > So erstellen Sie KI-Agenten, die jede Website nutzen können

So erstellen Sie KI-Agenten, die jede Website nutzen können

Susan Sarandon
Freigeben: 2025-01-08 00:02:40
Original
254 Leute haben es durchsucht

KI-Agenten mit dem Web verbinden: Die Reise eines Entwicklers und der Aufstieg der Computernutzung

Eine große Hürde bei der Entwicklung von KI-Agenten in den letzten zwei Jahren war die zuverlässige Gewährung des Webzugriffs. Stellen Sie sich einen KI-Agenten vor, der zum Versenden von E-Mails entwickelt wurde: Wie verbinden Sie ihn mit Gmail oder Outlook? APIs, Websites oder autonome Webagenten? In diesem Artikel werden verschiedene Methoden untersucht.

APIs und SDKs: Ein begrenzter Ansatz

Viele Entwickler nutzen APIs und SDKs. Dies bietet eine geringe Latenz und eine robuste Authentifizierung, es bestehen jedoch Einschränkungen:

  • API-Nichtverfügbarkeit:Nicht alle Webdienste bieten APIs.
  • Herausforderungen bei der Dokumentation:Veraltete oder schlecht geschriebene Dokumentation ist häufig.
  • Funktionslücken:APIs verfügen oft nicht über die volle Funktionalität ihrer entsprechenden Websites, was bestimmte Aufgaben behindert.

Glücklicherweise bieten mehrere Dienste API-Aufrufbibliotheken an:

  • Composio: Bietet Tools für KI-Agenten mit starker Authentifizierung.
  • Langchain-Tools: Eine Ressource für Langchain-/Graph-Agenten.
  • Apify: Eine riesige, von der Community betriebene API-Bibliothek.

Für den universellen Zugriff auf Webdienste müssen wir jedoch über APIs hinausgehen.

Website-Interaktion: Der menschliche Ansatz

Zuverlässige KI-Agent-Website-Interaktion ermöglicht die Automatisierung jeder webbasierten menschlichen Aufgabe. Aber wie?

Viele Entwickler nutzen zunächst Browser-Test-Frameworks wie Selenium oder Playwright. Dieser Ansatz steht jedoch vor Herausforderungen:

  • Zerbrechlichkeit:Website-Änderungen (z. B. A/B-Tests) können Skripte leicht beschädigen.
  • Erkennbarkeit:Testbrowser werden leicht identifiziert und blockiert.
  • Produktionsbereitstellung: Das Hosten von Browsern, die Verwaltung der Authentifizierung und rotierende Proxys sind in der Produktion komplex.

Um diese Probleme zu beheben, haben wir mit einem Browser-SDK experimentiert, das:

  1. Verwendet natürliche Sprachselektoren (z. B. get_element("find the login button")) anstelle von spröden CSS-Selektoren.
  2. Integriert die integrierte Authentifizierung.
  3. Bietet vorkonfiguriertes Remote-Hosting mit integrierten rotierenden Proxys, um Blockierungen zu verhindern.

Diese Arbeit, jetzt Open Source (Dendrite SDK), befindet sich nicht mehr in der aktiven Entwicklung, steht aber weiterhin zum Studium und zur Anpassung zur Verfügung. Ähnliche Alternativen sind:

  • AgentQL:Eine Python-Bibliothek.
  • Stagehand: Eine JavaScript/TypeScript-Bibliothek.

Computernutzung: Die Zukunft von Web-KI-Agenten?

Rich Suttons „Bitter Lesson“ unterstreicht die Dominanz verallgemeinerbarer KI-Lösungen, die mit zunehmender Rechenleistung skalierbar sind. Anthropics Computer Use verkörpert dieses Prinzip und ermöglicht es LLMs, Computer/Browser direkt über Maus- und Tastatureingaben zu steuern, wodurch Skripte und API-Aufrufe überflüssig werden. Ihr Ansatz legt den Schwerpunkt auf allgemeine Computerkenntnisse gegenüber aufgabenspezifischen Tools. Dies deckt sich perfekt mit der bitteren Lektion, die besagt, dass die vielseitigsten KI-Agenten wie Menschen direkt mit dem Internet interagieren werden. Erste Ergebnisse zeigen eine hohe Zuverlässigkeit bei komplexen Aufgaben mithilfe gut gestalteter Eingabeaufforderungen, die häufig durch den Eingabeaufforderungsverbesserer von Anthropic verbessert werden.

Fazit: Die Zukunft annehmen

Obwohl APIs nach wie vor wertvoll sind, dürfte die Zukunft für die meisten KI-Agenten computernutzungsähnliche Ansätze begünstigen. Wenn sich ein Agent anmelden und die Suchfunktion einer Website nutzen kann, um Schlussfolgerungen aus Top-Ergebnissen zu ziehen, warum sollte er sich dann auf die gesamte Datenbank über eine API verlassen? Für KI-Entwickler stellt sich die Frage, ob sie diesen verallgemeinerbaren Ansatz übernehmen sollen oder das Risiko eingehen, mit den Einschränkungen spezialisierterer Methoden konfrontiert zu werden.

Hinweis: Dies ist mein erster dev.to-Beitrag. Feedback zur Verbesserung zukünftiger Beiträge ist willkommen. Auch Fragen zu KI-Agenten oder KI-gesteuerter Aufgabenautomatisierung sind willkommen. How to Build AI Agents that can Use any Website How to Build AI Agents that can Use any Website How to Build AI Agents that can Use any Website How to Build AI Agents that can Use any Website

Das obige ist der detaillierte Inhalt vonSo erstellen Sie KI-Agenten, die jede Website nutzen können. Für weitere Informationen folgen Sie bitte anderen verwandten Artikeln auf der PHP chinesischen Website!

Erklärung dieser Website
Der Inhalt dieses Artikels wird freiwillig von Internetnutzern beigesteuert und das Urheberrecht liegt beim ursprünglichen Autor. Diese Website übernimmt keine entsprechende rechtliche Verantwortung. Wenn Sie Inhalte finden, bei denen der Verdacht eines Plagiats oder einer Rechtsverletzung besteht, wenden Sie sich bitte an admin@php.cn
Neueste Artikel des Autors
Beliebte Tutorials
Mehr>
Neueste Downloads
Mehr>
Web-Effekte
Quellcode der Website
Website-Materialien
Frontend-Vorlage