


Fudan NLP チームは、AI エージェントの現状と将来の概要を 1 つの記事で提供する、80 ページにわたる大規模モデル エージェントの概要を発表しました。
- 論文リンク: https://arxiv.org/pdf/2309.07864.pdf
- LLM -ベースのエージェントペーパーリスト: https://github.com/WooooDyy/LLM-Agent-Paper-List
モデルの固有の機能を強化することが、インテリジェント エージェントのさらなる開発を促進する重要な要素であることがわかりました。
- #制御端末
- : 通常、LLM で構成され、インテリジェント エージェントの中核となります。記憶や知識を保存するだけでなく、情報処理や意思決定などの不可欠な機能も担います。インテリジェントエージェントの一般化と移転可能性を反映して、推論と計画のプロセスを提示し、未知のタスクにうまく対処できます。
- : インテリジェント エージェントの知覚空間を純粋なテキストから拡張して、テキスト、視覚、聴覚などのマルチモーダル フィールドを含めます。周囲環境からの情報をより効果的に取得し、活用します。
- : 通常のテキスト出力に加えて、エージェントにはツールを具体化して使用する機能も与えられるため、環境の変化によりよく適応できます。フィードバックは環境と相互作用し、環境を形作ることもあります。
著者は、例を使用して LLM ベースのエージェントのワークフローを説明します。人間が雨が降るかどうか尋ねると、知覚端 (Perception) は指示を出します。 LLM が理解できる表現に変換されます。そして、制御端末(ブレイン)は、現在の天気やインターネット上の天気予報に基づいて推論と行動計画を開始します。最後に、アクションが応答して人間に傘を渡します。
上記のプロセスを繰り返すことにより、インテリジェント エージェントは継続的にフィードバックを取得し、環境と対話することができます。
#制御端末: 脳
自然言語インタラクション:
- 含意の理解: 直観的に表示されるコンテンツに加えて、言語は話者の意図や好みなどの情報も伝えることがあります。これは、エージェントがより効率的に通信し、協力するのに役立つことを意味しており、大規模なモデルはすでにこの点での可能性を示しています。
知識:
メモリ:
- 要約: 記憶を要約して、エージェントが記憶から重要な詳細を抽出する能力を強化します。
- 圧縮メモリ (圧縮): ベクトルまたは適切なデータ構造を使用してメモリを圧縮することにより、メモリの検索効率を向上させることができます。
推論と計画:
- 計画の振り返り: 計画を立てた後、それを振り返り、その長所と短所を評価できます。この種の反映は一般に 3 つの側面から生じます: 内部フィードバック メカニズムの使用、人間との対話からのフィードバックの取得、環境からのフィードバックの取得。
移行可能性と一般化:
- 視覚入力を対応するテキスト説明に変換します (画像キャプション): LLM が直接理解でき、解釈可能性が高くなります。
- 視覚情報をエンコードして表現します。ビジュアルベーシックモデル LLM のパラダイムを使用して認識モジュールを形成し、アライメント操作を通じてモデルがさまざまなモダリティの内容を理解できるようにします。エンドツーエンド方式のトレインで実行されます。
テキスト出力:
ツールの使用法:
具体化されたアクション:
これらのアトミック アクションを組み合わせることで、エージェントはより複雑なタスクを完了できます。たとえば、「キッチンにあるスイカはボウルより大きいですか?」などの QA タスクを具体化します。この問題を解決するには、エージェントはキッチンに移動し、両方のサイズを観察した後、答えを導き出す必要があります。 - 物理世界のハードウェアのコストが高く、具体化されたデータ セットが不足しているため、具体化されたアクションに関する現在の研究は依然として主にゲーム プラットフォーム「Minecraft」に焦点を当てています。仮想サンドボックス環境。したがって、著者らは、より現実に近いタスクパラダイムと評価基準を期待している一方で、関連するデータセットの効率的な構築についてさらなる探求も必要としています。
3. ユーザーの手を解放した後は、脳を解放してみてください: 最先端の科学分野の可能性を最大限に発揮し、革新的で探索的な作業を完了します。
これに基づいて、エージェントのアプリケーションには 3 つのパラダイムがあります:
タスク指向展開では、エージェントは人間のユーザーが基本的な日常タスクを処理するのを支援します。基本的なコマンドの理解、タスクの分解、環境と対話する能力が必要です。具体的には、既存のタスク タイプに応じて、エージェントの実際のアプリケーションをシミュレートされたネットワーク環境とシミュレートされた生活シナリオに分けることができます。 イノベーション指向の展開では、エージェントは最先端の科学分野における独立した調査の可能性を実証できます。固有の複雑さと専門分野からのトレーニング データの欠如がインテリジェント エージェントの構築を妨げていますが、化学、材料、コンピューターなどの分野ではすでに多くの研究が進歩しています。 ライフサイクル指向の展開では、エージェントはオープンワールドで継続的に探索、学習、新しいスキルを使用し、長期間生存することができます。このセクションでは、著者はゲーム「Minecraft」を例として取り上げます。ゲーム内のサバイバル チャレンジは現実世界の縮図と見なすことができるため、多くの研究者がエージェントの包括的な機能を開発およびテストするための独自のプラットフォームとしてゲームを使用してきました。
- すべてのエージェントが自分の意見や意見を自由に表現し、非連続的な方法で協力する場合、それは無秩序な協力と呼ばれます。
- すべてのエージェントが、流れ作業の形で自分の意見を 1 つずつ表明するなど、特定のルールに従う場合、協力プロセス全体が秩序正しくなり、これを秩序ある協力と呼びます。
名前が示すように、人間とエージェントの対話、インテリジェントエージェントは人間と協力してタスクを完了します。エージェントの動的な学習能力はコミュニケーションによってサポートされる必要がある一方で、現在のエージェントシステムは解釈性がまだ不十分であり、安全性や合法性などに問題がある可能性があるため、人間の関与が必要です。そして監督。
著者は、論文の中でヒューマン エージェントのインタラクションを次の 2 つのモードに分けています。
インストラクター兼実行者モード: 人間がインストラクターとして機能し、指示とフィードバックを与えます。エージェントは、指示に従って段階的に実行者として機能します。調整して最適化します。このモデルは、教育、医療、ビジネスなどの分野で広く使用されています。 イコール パートナーシップ モード: 一部の研究では、エージェントが人間とのコミュニケーションにおいて共感を示したり、平等な中間としてタスクの実行に参加したりできることが観察されています。知能エージェントは日常生活への応用の可能性を示しており、将来的には人間社会に組み込まれることが期待されています。
- ##左側の部分:
個人レベルでは、エージェントは計画、推論、考察など、内面化されたさまざまな行動を示します。さらに、エージェントは、認知、感情、性格の側面にわたる本質的な性格特性を示します。 - 中間部分:
単一のエージェントは、他の個々のエージェントとグループを形成して、共同で協力や他のグループ行動 (共同協力など) を実証できます。 - 右側の部分:
環境は、仮想サンドボックス環境または実際の物理世界の形式をとることができます。環境の要素には、人間と利用可能なさまざまなリソースが含まれます。単一のエージェントの場合、他のエージェントも環境の一部となります。 - 全体的なインタラクション:
エージェントは、外部環境を感知してアクションを実行することで、インタラクション プロセス全体に積極的に参加します。
##エージェントの社会的行動と性格
この記事では、外部の行動と内部の性格の観点から社会におけるエージェントのパフォーマンスを検証しています:
社会的な観点から出発点出発点として、行動は個人と集団の 2 つのレベルに分けることができます。
個人の行動は、エージェントの運用と開発の基礎を形成します。自体。これには、知覚によって表される入力、アクションによって表される出力、およびエージェント自身の内面化された行動が含まれます。
群集行動とは、2 人以上のエージェントが自発的に対話するときに発生する行動を指します。これには、協力に代表されるポジティブな行動、対立に代表されるネガティブな行動、そして群れに従う、監視するなどの中立的な行動が含まれます。
認知、感情、個性を含みます。人間が社会化のプロセスを通じて徐々に特性を発達させるのと同じように、エージェントも、グループや環境との相互作用を通じて徐々に人格を形成する、いわゆる「人間のような知性」を示します。
認知能力: エージェントが知識を獲得し、理解するプロセスをカバーします。研究によると、LLM ベースのエージェントは、いくつかの側面で人間のようなレベルを実証できます。熟慮と知性の。
心の知能指数: 喜び、怒り、悲しみ、喜びなどの主観的な感情や感情状態、そして同情や共感を示す能力が含まれます。 性格描写: LLM の性格特性を理解し分析するために、研究者はビッグ 5 性格テストや MBTI テストなどの成熟した評価方法を使用して、性格の多様性を調査してきました。そして複雑さ。
- 実際の物理環境:
物理環境は、エージェントが観察する実際のオブジェクトと空間で構成される具体的な環境です。そしてアクション。この環境では、豊富な感覚入力 (視覚、聴覚、空間) が導入されます。仮想環境とは異なり、物理空間ではエージェントの動作に対してより多くの要求が課されます。つまり、エージェントは物理環境に適応でき、実行可能なモーション コントロールを生成する必要があります。 著者は、物理環境の複雑さを説明するために例を挙げました: 工場内でロボット アームを操作するインテリジェント エージェントを想像してください。ロボット アームを操作するとき、異なる材質の物体の損傷を避けるには力が必要であり、さらに、エージェントは物理的なワークスペース内を移動し、障害物を回避してロボット アームの移動軌道を最適化するために、時間内に移動経路を調整する必要があります。 #これらの要件により、物理環境におけるエージェントの複雑さと課題が増大します。 #シミュレーション、開始!
#記事の中で、著者らは、模擬社会はオープンで永続的で状況に応じて組織化されている必要があると考えています。開放性はエージェントがシミュレーションされた社会に自律的に出入りすることを可能にします;永続性は社会が時間の経過とともに発展する一貫した軌道を持つことを意味します;文脈性は特定の環境における主体の存在と動作を強調します;組織化はシミュレーション社会が物理的な世界を持つことを保証します-ルールや制限など。
模擬社会の重要性については、スタンフォード大学の生成エージェントタウンがすべての人に鮮明な例を提供しています。エージェント社会は、次のようなグループインテリジェンスの能力の境界を探求するために使用できます。エージェントが共同でバレンタイン デー パーティーを企画したり、ソーシャル ネットワークをシミュレートしてコミュニケーション現象を観察するなど、社会科学研究を加速するためにも使用できます。さらに、倫理的な意思決定シナリオをシミュレーションすることでエージェントの背後にある価値観を探ったり、政策が社会に与える影響をシミュレーションすることで意思決定を支援したりする研究も行われています。
さらに、著者は、これらのシミュレーションには、有害な社会現象、固定観念と偏見、プライバシーとセキュリティの問題、その他のリスクを含むがこれらに限定されない特定のリスクも伴う可能性があると指摘しています。 -依存性と大人の中毒性。 未解決の質問 大規模モデルは、言語理解、意思決定、汎化能力において強力な可能性を示しており、エージェント構築プロセスにおいて重要な役割を果たしています。エージェントの進歩により、大規模モデルに対する要件もさらに高まっています。
最後にこの論文では、著者はいくつかの将来を見据えた未解決の質問についても議論し、読者に次のことについて考えるためのインスピレーションを提供しています。モデルはお互いを促進し、一緒に開発しますか?LLM ベースのエージェントはどのような課題や懸念をもたらすのでしょうか? インテリジェント エージェントを本当に実装できるかどうかには、現実世界への危害を避けるための厳密なセキュリティ評価が必要です。著者は、違法虐待、失業のリスク、人間の幸福への影響など、さらに多くの潜在的な脅威を要約しています。 #スケールアップはどのような機会と課題をもたらすのでしょうか? シミュレーション社会では、個人の数を増やすことでシミュレーションの信頼性と信頼性を大幅に向上させることができます。ただし、エージェントの数が増加するにつれて、通信およびメッセージ配布の問題は非常に複雑になり、情報の歪曲、誤解、または幻覚によってシミュレーション システム全体の効率が大幅に低下します。 LLM ベースのエージェントが AGI への適切なパスであるかどうかについて、インターネット上で議論があります。 研究者の中には、GPT-4 に代表される大規模モデルは十分なコーパスでトレーニングされており、これに基づいて構築されたエージェントは AGI への扉を開く鍵となる可能性があると信じている人もいます。しかし、他の研究者は、自己回帰言語モデリングは反応するだけなので、本当の知能は示さないと考えています。ワールド モデルなどのより完全なモデリング手法は、AGI につながる可能性があります。#群知能の進化。群知能は、多くの人々の意見を収集し、それらを意思決定に変換するプロセスです。 しかし、エージェントの数を増やすだけで真の「知性」は生み出されるのでしょうか?さらに、知的エージェントの社会が「集団思考」や個人の認知バイアスを克服できるようにするために、個々のエージェントをどのように調整すればよいでしょうか? サービスとしてのエージェント (AaaS)。 LLM ベースのエージェントは大規模モデル自体よりも複雑であり、中小企業や個人がローカルに構築するのはより困難であるため、クラウド ベンダーはサービスの形式でインテリジェント エージェントを実装することを検討できます。サービスとしてのエージェント。他のクラウド サービスと同様、AaaS には、ユーザーに高い柔軟性とオンデマンドのセルフサービスを提供する可能性があります。
以上がFudan NLP チームは、AI エージェントの現状と将来の概要を 1 つの記事で提供する、80 ページにわたる大規模モデル エージェントの概要を発表しました。の詳細内容です。詳細については、PHP 中国語 Web サイトの他の関連記事を参照してください。

ホットAIツール

Undresser.AI Undress
リアルなヌード写真を作成する AI 搭載アプリ

AI Clothes Remover
写真から衣服を削除するオンライン AI ツール。

Undress AI Tool
脱衣画像を無料で

Clothoff.io
AI衣類リムーバー

AI Hentai Generator
AIヘンタイを無料で生成します。

人気の記事

ホットツール

メモ帳++7.3.1
使いやすく無料のコードエディター

SublimeText3 中国語版
中国語版、とても使いやすい

ゼンドスタジオ 13.0.1
強力な PHP 統合開発環境

ドリームウィーバー CS6
ビジュアル Web 開発ツール

SublimeText3 Mac版
神レベルのコード編集ソフト(SublimeText3)

ホットトピック









これも Tusheng のビデオですが、PaintsUndo は別の道を歩んでいます。 ControlNet 作者 LvminZhang が再び生き始めました!今回は絵画の分野を目指します。新しいプロジェクト PaintsUndo は、開始されて間もなく 1.4kstar を獲得しました (まだ異常なほど上昇しています)。プロジェクトアドレス: https://github.com/lllyasviel/Paints-UNDO このプロジェクトを通じて、ユーザーが静止画像を入力すると、PaintsUndo が線画から完成品までのペイントプロセス全体のビデオを自動的に生成するのに役立ちます。 。描画プロセス中の線の変化は驚くべきもので、最終的なビデオ結果は元の画像と非常によく似ています。完成した描画を見てみましょう。

AIxivコラムは、当サイトが学術的・技術的な内容を掲載するコラムです。過去数年間で、このサイトの AIxiv コラムには 2,000 件を超えるレポートが寄せられ、世界中の主要な大学や企業のトップ研究室がカバーされ、学術交流と普及を効果的に促進しています。共有したい優れた作品がある場合は、お気軽に寄稿するか、報告のために当社までご連絡ください。提出メール: liyazhou@jiqizhixin.com; zhaoyunfeng@jiqizhixin.com 人工知能の開発プロセスにおいて、大規模言語モデル (LLM) の制御とガイダンスは常に中心的な課題の 1 つであり、これらのモデルが両方とも確実に機能することを目指しています。強力かつ安全に人類社会に貢献します。初期の取り組みは人間のフィードバックによる強化学習手法に焦点を当てていました (RL

AIxivコラムは、当サイトが学術的・技術的な内容を掲載するコラムです。過去数年間で、このサイトの AIxiv コラムには 2,000 件を超えるレポートが寄せられ、世界中の主要な大学や企業のトップ研究室がカバーされ、学術交流と普及を効果的に促進しています。共有したい優れた作品がある場合は、お気軽に寄稿するか、報告のために当社までご連絡ください。提出電子メール: liyazhou@jiqizhixin.com; zhaoyunfeng@jiqizhixin.com この論文の著者は全員、イリノイ大学アーバナ シャンペーン校 (UIUC) の Zhang Lingming 教師のチームのメンバーです。博士課程4年、研究者

AIモデルによって与えられた答えがまったく理解できない場合、あなたはそれをあえて使用しますか?機械学習システムがより重要な分野で使用されるにつれて、なぜその出力を信頼できるのか、またどのような場合に信頼してはいけないのかを実証することがますます重要になっています。複雑なシステムの出力に対する信頼を得る方法の 1 つは、人間または他の信頼できるシステムが読み取れる、つまり、考えられるエラーが発生する可能性がある点まで完全に理解できる、その出力の解釈を生成することをシステムに要求することです。見つかった。たとえば、司法制度に対する信頼を築くために、裁判所に対し、決定を説明し裏付ける明確で読みやすい書面による意見を提供することを求めています。大規模な言語モデルの場合も、同様のアプローチを採用できます。ただし、このアプローチを採用する場合は、言語モデルが

LLM に因果連鎖を示すと、LLM は公理を学習します。 AI はすでに数学者や科学者の研究を支援しています。たとえば、有名な数学者のテレンス タオは、GPT などの AI ツールを活用した研究や探索の経験を繰り返し共有しています。 AI がこれらの分野で競争するには、強力で信頼性の高い因果推論能力が不可欠です。この記事で紹介する研究では、小さなグラフでの因果的推移性公理の実証でトレーニングされた Transformer モデルが、大きなグラフでの推移性公理に一般化できることがわかりました。言い換えれば、Transformer が単純な因果推論の実行を学習すると、より複雑な因果推論に使用できる可能性があります。チームが提案した公理的トレーニング フレームワークは、デモンストレーションのみで受動的データに基づいて因果推論を学習するための新しいパラダイムです。

乾杯!紙面でのディスカッションが言葉だけになると、どんな感じになるでしょうか?最近、スタンフォード大学の学生が、arXiv 論文のオープン ディスカッション フォーラムである alphaXiv を作成しました。このフォーラムでは、arXiv 論文に直接質問やコメントを投稿できます。 Web サイトのリンク: https://alphaxiv.org/ 実際、URL の arXiv を alphaXiv に変更するだけで、alphaXiv フォーラムの対応する論文を直接開くことができます。この Web サイトにアクセスする必要はありません。その中の段落を正確に見つけることができます。論文、文: 右側のディスカッション エリアでは、ユーザーは論文のアイデアや詳細について著者に尋ねる質問を投稿できます。たとえば、次のような論文の内容についてコメントすることもできます。

最近、2000年代の7大問題の一つとして知られるリーマン予想が新たなブレークスルーを達成した。リーマン予想は、数学における非常に重要な未解決の問題であり、素数の分布の正確な性質に関連しています (素数とは、1 とそれ自身でのみ割り切れる数であり、整数論において基本的な役割を果たします)。今日の数学文献には、リーマン予想 (またはその一般化された形式) の確立に基づいた 1,000 を超える数学的命題があります。言い換えれば、リーマン予想とその一般化された形式が証明されれば、これらの 1,000 を超える命題が定理として確立され、数学の分野に重大な影響を与えることになります。これらの命題の一部も有効性を失います。 MIT数学教授ラリー・ガスとオックスフォード大学から新たな進歩がもたらされる

現在、次のトークン予測パラダイムを使用した自己回帰大規模言語モデルが世界中で普及していると同時に、インターネット上の多数の合成画像やビデオがすでに拡散モデルの威力を示しています。最近、MITCSAIL の研究チーム (そのうちの 1 人は MIT の博士課程学生、Chen Boyuan です) は、全系列拡散モデルとネクスト トークン モデルの強力な機能を統合することに成功し、トレーニングおよびサンプリング パラダイムである拡散強制 (DF) を提案しました。 )。論文タイトル:DiffusionForcing:Next-tokenPredictionMeetsFull-SequenceDiffusion 論文アドレス:https:/
