Kuaishou 및 Beida 다중 모드 대형 모델: 이미지는 외국어이며 DALLE-3의 획기적인 제품과 비슷합니다.
동적 시각적 단어 분할 통합 그래픽 및 텍스트 표현인 Kuaishou와 Peking University는 다중 모드 이해 및 생성 작업 목록을 정리하기 위해 기본 모델 LaVIT를 제안하기 위해 협력했습니다.
GPT, LLaMA 등과 같은 현재의 대규모 언어 모델은 자연어 처리 분야에서 상당한 발전을 이루었으며 복잡한 텍스트 콘텐츠를 이해하고 생성할 수 있습니다. 그러나 우리는 이 강력한 이해와 생성 능력을 다중 모드 데이터로 이전하는 것을 고려해 보았습니까? 이를 통해 우리는 방대한 양의 이미지와 비디오를 쉽게 이해하고 풍부한 일러스트레이션 콘텐츠를 만들 수 있습니다. 이 비전을 실현하기 위해 Kuaishou와 Peking University는 최근 LaVIT라는 새로운 다중 모드 대형 모델을 개발하기 위해 협력했습니다. LaVIT는 이 아이디어를 점차 현실화하고 있으며, 앞으로의 발전을 기대합니다.
논문 제목: Unified Language-Vision Pretraining in LLM with Dynamic Discrete Visual Tokenization
논문 주소: https://arxiv.org/abs/2309.04669
코드 모델 주소: https: //github.com/jy0205/LaVIT
모델 개요
LaVIT는 시각적 콘텐츠를 이해하고 생성할 수 있는 언어 모델과 유사한 새로운 일반 다중 모드 기본 모델입니다. LaVIT의 교육 패러다임은 대규모 언어 모델의 성공적인 경험을 바탕으로 하며 자동 회귀 접근 방식을 사용하여 다음 이미지 또는 텍스트 토큰을 예측합니다. 교육 후 LaVIT는 추가 미세 조정 없이 다중 모드 이해 및 생성 작업을 수행할 수 있는 다중 모드 범용 인터페이스 역할을 할 수 있습니다. 예를 들어 LaVIT에는 다음과 같은 기능이 있습니다.
LaVIT는 텍스트 프롬프트를 기반으로 고품질, 다양한 종횡비 및 미적인 이미지를 생성할 수 있는 고급 이미지 생성 모델입니다. LaVIT의 이미지 생성 기능은 Parti, SDXL 및 DALLE-3과 같은 최첨단 이미지 생성 모델과 비교하여 우수합니다. 고품질의 텍스트-이미지 생성을 효과적으로 달성하여 사용자에게 더 많은 선택권과 더 나은 시각적 경험을 제공할 수 있습니다.
다중 모드 프롬프트 기반 이미지 생성: LaVIT에서는 이미지와 텍스트가 이산화된 토큰으로 균일하게 표현되므로 여러 모달 조합(예: 텍스트, 이미지 + 텍스트, 이미지 + 이미지)을 프롬프트로 허용할 수 있습니다. 미세 조정 없이 해당 이미지를 생성합니다.
이미지 내용 이해 및 질문에 답하기: 입력 이미지가 주어지면 LaVIT는 이미지 내용을 읽고 의미를 이해할 수 있습니다. 예를 들어, 모델은 입력 이미지에 대한 캡션을 제공하고 해당 질문에 답할 수 있습니다.
방법 개요
LaVIT의 모델 구조는 아래 그림에 나와 있습니다. 전체 최적화 프로세스는 두 단계로 구성됩니다.
그림: LaVIT 모델의 전체 아키텍처
1단계 : 동적 시각적 토크나이저
자연어와 같은 시각적 콘텐츠를 이해하고 생성할 수 있도록 LaVIT는 시각적 콘텐츠(연속적인 신호)를 텍스트와 같은 토큰 시퀀스로 변환하는 잘 설계된 시각적 토크나이저를 도입합니다. LLM이 이해할 수 있는 외국어 같은 거죠. 저자는 통일된 비전과 언어 모델링을 이루기 위해서는 시각적 토크나이저(Tokenizer)가 다음과 같은 두 가지 특성을 가져야 한다고 믿습니다.Discretization: 시각적 토큰은 텍스트처럼 이산화된 형태로 표현되어야 합니다. 이는 두 가지 양식에 대한 통합 표현 형식을 사용하며, 이는 통합된 자동 회귀 생성 훈련 프레임워크에서 다중 모드 모델링 최적화를 위해 동일한 분류 손실을 사용하는 LaVIT에 도움이 됩니다.
Dynamicification: 텍스트 토큰과 달리 이미지 패치는 그들 사이에 상당한 상호 의존성을 가지므로 한 패치를 다른 패치에서 추론하는 것이 상대적으로 간단합니다. 따라서 이러한 의존성은 원래 LLM의 다음 토큰 예측 최적화 목표의 효율성을 감소시킵니다. LaVIT는 다양한 이미지의 다양한 의미적 복잡성을 기반으로 동적 수의 시각적 토큰을 인코딩하는 토큰 병합을 사용하여 시각적 패치 간의 중복성을 줄이는 것을 제안합니다. 이러한 방식으로 복잡성이 다른 이미지의 경우 동적 토큰 인코딩을 사용하면 사전 학습의 효율성이 더욱 향상되고 중복 토큰 계산이 방지됩니다.
그림: (a) 동적 시각적 토큰 생성기 (b) 토큰 결합기
동적 시각적 토크나이저에는 토큰 선택기와 토큰 결합기가 포함되어 있습니다. 그림에서 볼 수 있듯이 토큰 선택기는 가장 유익한 이미지 블록을 선택하는 데 사용되는 반면, 토큰 병합은 유익하지 않은 시각적 블록의 정보를 보유 토큰으로 압축하여 중복 토큰을 병합하는 데 사용됩니다. 전체 동적 시각적 단어 분할기는 입력 이미지의 의미 재구성을 최대화하여 학습됩니다.
토큰 선택기
토큰 선택기는 N개의 이미지 블록 수준 기능을 입력으로 받고 각 이미지 블록의 중요성을 평가하고 전체 이미지를 완전히 표현하기 위해 가장 많은 양의 정보가 있는 블록을 선택하는 것입니다. 이 목표를 달성하기 위해 여러 MLP 레이어로 구성된 경량 모듈을 사용하여 분포 π를 예측합니다. 분포 π에서 샘플링하여 해당 이미지 패치를 유지할지 여부를 나타내는 이진 결정 마스크가 생성됩니다.
토큰 결합기
토큰 결합기는 N개의 이미지 블록을 생성된 결정 마스크에 따라 X_r을 유지하고 X_d를 폐기하는 두 그룹으로 나눕니다. X_d를 직접 버리는 것과 달리 토큰 결합기는 입력 이미지의 세부 의미를 최대한 보존할 수 있습니다. 토큰 결합기는 L 개의 블록으로 구성되며 각 블록에는 Causal Self-Attention 레이어, Cross-Attention 레이어 및 Feed-forward 레이어가 포함됩니다. Causal self-attention 레이어에서 X_r의 각 토큰은 LLM의 텍스트 토큰 형식과의 일관성을 보장하기 위해 이전 토큰에만 주의를 기울입니다. 이 전략은 양방향 self-attention에 비해 성능이 더 좋습니다. 교차 주의 계층은 보유된 토큰 X_r을 쿼리로 사용하고 의미론적 유사성을 기반으로 X_d의 토큰을 병합합니다.
2단계: 통합 생성 사전 훈련
시각적 단어 분할기에 의해 처리된 시각적 토큰은 텍스트 토큰과 연결되어 훈련 중 입력으로 다중 모달 시퀀스를 형성합니다. 두 가지 양식을 구별하기 위해 저자는 이미지 토큰 시퀀스의 시작과 끝 부분에 특수 토큰인 [IMG] 및 [/IMG]를 삽입합니다. 이는 시각적 콘텐츠의 시작과 끝을 나타내는 데 사용됩니다. LaVIT는 텍스트와 이미지를 생성하기 위해 [이미지, 텍스트] 및 [텍스트;
이러한 다중 모드 입력 시퀀스의 경우 LaVIT는 통합된 자동 회귀 접근 방식을 사용하여 사전 훈련을 위한 각 다중 모드 시퀀스의 가능성을 직접 최대화합니다. 표현 공간과 교육 방법의 완전한 통합은 LLM이 다중 모드 상호 작용 및 정렬을 더 잘 학습하는 데 도움이 됩니다. Pre-training이 완료되면 LaVIT는 이미지를 인지하는 능력을 갖게 되며 텍스트와 같은 이미지를 이해하고 생성할 수 있습니다.
실험
제로샷 다중 모드 이해
LaVIT는 이미지 캡션 생성(NoCaps, Flickr30k) 및 시각적 질문 응답(VQAv2)과 같은 제로 샷 다중 모드 이해 작업에서 최첨단 결과를 달성했습니다. , OKVQA, GQA, VizWiz) 최고의 성능.
표 1 Zero-shot 다중모달 이해 작업 평가
Zero-shot 다중모달 생성
본 실험에서는 제안된 시각적 토크나이저가 이미지를 이산화 토큰으로 표현할 수 있으므로 LaVIT 자동 회귀를 통해 텍스트와 같은 시각적 토큰을 생성하여 이미지를 합성하는 기능이 있습니다. 저자는 제로샘플 텍스트 조건에서 모델의 이미지 합성 성능을 정량적으로 평가하였고, 비교 결과는 Table 2와 같다.
표 2 다양한 모델의 제로샷 텍스트-이미지 생성 성능
표에서 볼 수 있듯이 LaVIT는 다른 모든 다중 모달 언어 모델보다 성능이 뛰어납니다. Emu와 비교하여 LaVIT는 더 작은 LLM 모델에서 추가 개선을 달성하여 탁월한 시각적-언어적 정렬 기능을 보여줍니다. 또한 LaVIT는 더 적은 훈련 데이터를 사용하면서 최첨단 텍스트-이미지 전문가 Parti와 비슷한 성능을 달성합니다.
멀티 모달 프롬프트 이미지 생성
LaVIT는 여러 모달 조합을 프롬프트로 원활하게 수용하고 미세 조정 없이 해당 이미지를 생성할 수 있습니다. LaVIT는 주어진 다중 모드 큐의 스타일과 의미를 정확하게 반영하는 이미지를 생성합니다. 그리고 입력의 다중 모드 단서를 사용하여 원본 입력 이미지를 수정할 수 있습니다. Stable Diffusion과 같은 기존 이미지 생성 모델은 추가로 미세 조정된 다운스트림 데이터 없이는 이 기능을 달성할 수 없습니다.
멀티모달 이미지 생성 결과 예시
정성분석
아래 그림과 같이 LaVIT의 동적 토크나이저는 이미지 콘텐츠를 기반으로 가장 유익한 이미지 블록을 동적으로 선택할 수 있으며, 학습된 코드는 높은 수준의 의미를 지닌 시각적 인코딩을 생성할 수 있습니다.
동적 시각적 토크나이저 시각화(왼쪽) 및 학습된 코드북(오른쪽)
요약
LaVIT의 출현은 다중 모드 작업 처리에 혁신적인 패러다임을 제공하며 성공적인 기술을 계승합니다. 비전과 언어를 통합된 개별 토큰 표현으로 표현하기 위해 동적 시각적 토크나이저를 사용하여 LLM의 자동 회귀 생성 학습 패러다임을 제공합니다. LaVIT는 통합된 생성 목표에 따라 최적화함으로써 이미지를 외국어처럼 취급하고 텍스트처럼 이해하고 생성할 수 있습니다. 이 방법의 성공은 LLM의 강력한 추론 기능을 사용하여 보다 스마트하고 포괄적인 다중 모드 이해 및 생성을 위한 새로운 가능성을 열어 미래 다중 모드 연구의 개발 방향에 대한 새로운 영감을 제공합니다.
위 내용은 Kuaishou 및 Beida 다중 모드 대형 모델: 이미지는 외국어이며 DALLE-3의 획기적인 제품과 비슷합니다.의 상세 내용입니다. 자세한 내용은 PHP 중국어 웹사이트의 기타 관련 기사를 참조하세요!

핫 AI 도구

Undresser.AI Undress
사실적인 누드 사진을 만들기 위한 AI 기반 앱

AI Clothes Remover
사진에서 옷을 제거하는 온라인 AI 도구입니다.

Undress AI Tool
무료로 이미지를 벗다

Clothoff.io
AI 옷 제거제

AI Hentai Generator
AI Hentai를 무료로 생성하십시오.

인기 기사

뜨거운 도구

메모장++7.3.1
사용하기 쉬운 무료 코드 편집기

SublimeText3 중국어 버전
중국어 버전, 사용하기 매우 쉽습니다.

스튜디오 13.0.1 보내기
강력한 PHP 통합 개발 환경

드림위버 CS6
시각적 웹 개발 도구

SublimeText3 Mac 버전
신 수준의 코드 편집 소프트웨어(SublimeText3)

뜨거운 주제











하지만 공원에 있는 노인을 이길 수는 없을까요? 파리올림픽이 본격화되면서 탁구가 많은 주목을 받고 있다. 동시에 로봇은 탁구 경기에서도 새로운 돌파구를 마련했습니다. 방금 DeepMind는 탁구 경기에서 인간 아마추어 선수 수준에 도달할 수 있는 최초의 학습 로봇 에이전트를 제안했습니다. 논문 주소: https://arxiv.org/pdf/2408.03906 DeepMind 로봇은 탁구를 얼마나 잘 치나요? 아마도 인간 아마추어 선수들과 동등할 것입니다: 포핸드와 백핸드 모두: 상대는 다양한 플레이 스타일을 사용하고 로봇도 견딜 수 있습니다: 다양한 스핀으로 서브를 받습니다. 그러나 게임의 강도는 그만큼 강렬하지 않은 것 같습니다. 공원에 있는 노인. 로봇용, 탁구용

8월 21일, 2024년 세계로봇대회가 베이징에서 성대하게 개최되었습니다. SenseTime의 홈 로봇 브랜드 "Yuanluobot SenseRobot"은 전체 제품군을 공개했으며, 최근에는 Yuanluobot AI 체스 두는 로봇인 체스 프로페셔널 에디션(이하 "Yuanluobot SenseRobot")을 출시하여 세계 최초의 A 체스 로봇이 되었습니다. 집. Yuanluobo의 세 번째 체스 게임 로봇 제품인 새로운 Guoxiang 로봇은 AI 및 엔지니어링 기계 분야에서 수많은 특별한 기술 업그레이드와 혁신을 거쳤으며 처음으로 3차원 체스 말을 집는 능력을 실현했습니다. 가정용 로봇의 기계 발톱을 통해 체스 게임, 모두 체스 게임, 기보 복습 등과 같은 인간-기계 기능을 수행합니다.

개학이 코앞으로 다가왔습니다. 새 학기를 앞둔 학생들뿐만 아니라 대형 AI 모델도 스스로 관리해야 합니다. 얼마 전 레딧에는 클로드가 게으르다고 불평하는 네티즌들이 붐볐습니다. "레벨이 많이 떨어졌고, 자주 멈췄고, 심지어 출력도 매우 짧아졌습니다. 출시 첫 주에는 4페이지 전체 문서를 한 번에 번역할 수 있었지만 지금은 반 페이지도 출력하지 못합니다. !" https://www.reddit.com/r/ClaudeAI/comments/1by8rw8/something_just_feels_wrong_with_claude_in_the/ "클로드에게 완전히 실망했습니다"라는 제목의 게시물에

베이징에서 열린 세계로봇컨퍼런스에서는 휴머노이드 로봇의 전시가 현장의 절대 화두가 됐다. 스타더스트 인텔리전트 부스에서는 AI 로봇 어시스턴트 S1이 덜시머, 무술, 서예 3대 퍼포먼스를 선보였다. 문학과 무술을 모두 갖춘 하나의 전시 공간은 수많은 전문 관객과 미디어를 끌어 모았습니다. 탄력 있는 현의 우아한 연주를 통해 S1은 정밀한 작동과 속도, 힘, 정밀성을 갖춘 절대적인 제어력을 보여줍니다. CCTV 뉴스는 '서예'의 모방 학습 및 지능형 제어에 대한 특별 보도를 진행했습니다. 회사 설립자 Lai Jie는 부드러운 움직임 뒤에 하드웨어 측면이 최고의 힘 제어와 가장 인간과 유사한 신체 지표(속도, 하중)를 추구한다고 설명했습니다. 등)이지만 AI측에서는 사람의 실제 움직임 데이터를 수집해 로봇이 강한 상황에 직면했을 때 더욱 강해지고 빠르게 진화하는 방법을 학습할 수 있다. 그리고 민첩하다

참가자들은 이번 ACL 컨퍼런스에서 많은 것을 얻었습니다. ACL2024는 6일간 태국 방콕에서 개최됩니다. ACL은 전산언어학 및 자연어 처리 분야 최고의 국제학술대회로 국제전산언어학회(International Association for Computational Linguistics)가 주최하고 매년 개최된다. ACL은 NLP 분야에서 학술 영향력 1위를 항상 차지하고 있으며, CCF-A 추천 컨퍼런스이기도 합니다. 올해로 62회째를 맞이하는 ACL 컨퍼런스에는 NLP 분야의 최신 저서가 400편 이상 접수됐다. 어제 오후 컨퍼런스에서는 최우수 논문과 기타 상을 발표했습니다. 이번에 최우수논문상 7개(미출판 2개), 우수주제상 1개, 우수논문상 35개가 있다. 이 컨퍼런스에서는 또한 3개의 리소스 논문상(ResourceAward)과 사회적 영향상(Social Impact Award)을 수상했습니다.

오늘 오후 Hongmeng Zhixing은 공식적으로 새로운 브랜드와 신차를 환영했습니다. 8월 6일, Huawei는 Hongmeng Smart Xingxing S9 및 Huawei 전체 시나리오 신제품 출시 컨퍼런스를 개최하여 파노라마식 스마트 플래그십 세단 Xiangjie S9, 새로운 M7Pro 및 Huawei novaFlip, MatePad Pro 12.2인치, 새로운 MatePad Air, Huawei Bisheng을 선보였습니다. 레이저 프린터 X1 시리즈, FreeBuds6i, WATCHFIT3 및 스마트 스크린 S5Pro를 포함한 다양한 새로운 올-시나리오 스마트 제품, 스마트 여행, 스마트 오피스, 스마트 웨어에 이르기까지 화웨이는 풀 시나리오 스마트 생태계를 지속적으로 구축하여 소비자에게 스마트한 경험을 제공합니다. 만물인터넷. Hongmeng Zhixing: 스마트 자동차 산업의 업그레이드를 촉진하기 위한 심층적인 권한 부여 화웨이는 중국 자동차 산업 파트너와 손을 잡고

비전과 로봇 학습의 긴밀한 통합. 최근 화제를 모으고 있는 1X 휴머노이드 로봇 네오(NEO)와 두 개의 로봇 손이 원활하게 협력해 옷 개기, 차 따르기, 신발 싸기 등을 하는 모습을 보면 마치 로봇 시대로 접어들고 있다는 느낌을 받을 수 있다. 실제로 이러한 부드러운 움직임은 첨단 로봇 기술 + 정교한 프레임 디자인 + 다중 모드 대형 모델의 산물입니다. 우리는 유용한 로봇이 종종 환경과 복잡하고 절묘한 상호작용을 요구한다는 것을 알고 있으며, 환경은 공간적, 시간적 영역에서 제약으로 표현될 수 있습니다. 예를 들어, 로봇이 차를 따르도록 하려면 먼저 로봇이 찻주전자 손잡이를 잡고 차를 흘리지 않고 똑바로 세운 다음, 주전자 입구와 컵 입구가 일치할 때까지 부드럽게 움직여야 합니다. 을 누른 다음 주전자를 특정 각도로 기울입니다. 이것

기계력 보고서 편집자: Yang Wen AI 영상계의 왕이 될 수 있는 사람은 누구일까요? 미국 TV 시리즈 '왕좌의 게임'에는 '철왕좌'가 있다. 전설에 따르면 적들이 버린 수천 자루의 검을 녹인 거대 용 '흑사병'이 최고의 권위를 상징한다는 전설이 있다. 이 철의자에 앉기 위해 대가족들은 싸우고 또 싸우기 시작했습니다. 소라 등장 이후 AI 영상계에 왕성한 '왕좌의 게임'이 론칭됐다. 이 게임의 주역으로는 바다 건너편의 RunwayGen-3와 Luma는 물론 국내 Kuaishou Keling, ByteDream, 및 Zhimo, Vidu, PixVerseV2 등. 오늘은 AI 영상계의 '철왕좌'에 앉을 자격이 있는 사람이 누구인지 평가하고 알아보겠습니다. -1- 빈센트 비디오
