생성 속도는 SDXL보다 두 배 빠르며 9GB GPU에서도 실행될 수 있어 가격 대비 성능 비율이 향상되었습니다.
하드웨어 요구 사항은 점점 낮아지고 있으며, 생성 속도는 점점 빨라지고 있습니다.
안정성 AI는 텍스트-이미지 변환의 선구자로서 트렌드를 선도할 뿐만 아니라 모델 품질에서도 지속적으로 새로운 혁신을 이루고 있습니다. 이번에는 코스트 퍼포먼스의 획기적인 발전을 이루었습니다.
불과 며칠 전 Stability AI는 또 다른 새로운 움직임을 보였습니다. Stable Cascade의 연구 미리보기 버전이 출시되었습니다. 이 텍스트-이미지 모델은 하드웨어 장벽을 더욱 제거하는 데 중점을 두고 품질, 유연성, 미세 조정 및 효율성에 대한 새로운 벤치마크를 설정하는 3단계 접근 방식을 도입하여 혁신을 이루었습니다. 또한 Stability AI는 훈련 및 추론 코드를 출시하여 모델과 출력을 추가로 사용자 정의할 수 있습니다. 모델은 디퓨저 라이브러리에서 추론할 수 있습니다. 이 모델은 비상업적 라이센스에 따라 출시되므로 비상업적 사용만 허용됩니다.
- 원본 링크: https://stability.ai/news/introducing-stable-cascade
- 코드 주소: https://github.com/Stability-AI/StableCascade
- Experience 주소: https://huggingface.co/spaces/multimodalart/stable-cascade
출처: https://twitter.com/multimodalart/status/1757391981074903446
Stable Cascade는 매우 빠르게 생성됩니다. X 플랫폼 사용자 @GozukaraFurkan은 약 9GB의 GPU 메모리만 필요하며 속도는 여전히 잘 유지될 수 있다고 게시했습니다.. 짧은 단어/문장 생성 정확도가 상대적으로 높으며, 긴 문장도 일정 확률로 완성할 수 있습니다(영어만 해당). 텍스트와 이미지의 통합도 매우 좋습니다. ㅋㅋㅋ >
사용자 @AIWarper는 다양한 아티스트 스타일 테스트를 시도했습니다.프롬프트: Elm Street의 악몽. 아티스트 스타일 참조는 다음과 같습니다: 왼쪽 위 신카이 마코토, 왼쪽 아래 토머 하누카, 오른쪽 위 라파엘 키르히너, 오른쪽 아래 야마모토 다카토.
그러나 캐릭터의 얼굴을 생성해 보면 캐릭터의 피부 디테일이 별로 좋지 않은 것을 볼 수 있으며, "10레벨 피부 갈기" 같은 느낌을 줍니다. ㅋㅋㅋStable Cascade는 Stable Diffusion 모델 시리즈와 다릅니다. 이는 A, B, C 단계로 구성된 파이프라인의 세 가지 모델을 기반으로 합니다. 이 아키텍처는 이미지의 계층적 압축을 수행하고 고도로 압축된 잠재 공간을 활용하여 뛰어난 출력을 달성할 수 있습니다. 이 부분들은 어떻게 서로 맞물리나요?
잠재 이미지 생성기 단계(C단계)는 사용자 입력을 컴팩트한 24x24 잠재 표현으로 변환한 다음 이미지 압축을 위해 잠재 디코더 단계(A 및 B단계)로 전달합니다. 이는 VAE 작업과 유사합니다. 안정적인 확산이 가능하지만 더 높은 압축률을 달성할 수 있습니다. 텍스트 조건 생성(단계 C)을 디코딩에서 고해상도 픽셀 공간(단계 A 및 B)으로 분리함으로써 훈련과 유사하게 ControlNets 및 LoRA를 포함하여 단계 C에서 추가 훈련 또는 미세 조정을 완료할 수 있습니다. 동일한 크기의 Stable Diffusion 모델로 비용을 1/16로 줄일 수 있습니다. 단계 A와 B는 추가 제어를 위해 선택적으로 미세 조정할 수 있지만 이는 안정 확산 모델에서 VAE를 미세 조정하는 것과 유사합니다. 대부분의 경우 그렇게 하면 얻을 수 있는 이점은 미미합니다. 따라서 대부분의 목적에 대해 Stability AI는 공식적으로 C 단계만 교육하고 A 단계와 B 단계의 원래 상태를 사용할 것을 권장합니다. Phase C와 B는 Phase C의 경우 1B 및 3.6B 매개변수 모델, Phase B의 경우 700M 및 1.5B 매개변수 모델의 두 가지 모델을 출시합니다. Stage C에는 3.6B 매개변수가 있는 모델이 가장 높은 품질의 출력을 제공하므로 권장됩니다. 그러나 최소 하드웨어 요구 사항을 원하는 경우 1B 매개변수 버전을 사용할 수 있습니다. Stage B의 경우 두 릴리스 모두 좋은 결과를 얻었지만 1.5B 매개변수 버전은 재구성 세부 사항 측면에서 더 나은 성능을 발휘합니다. Stable Cascade의 모듈식 접근 방식 덕분에 추론을 위한 예상 VRAM 요구 사항을 약 20GB로 유지할 수 있습니다. 이는 더 작은 변형을 사용하여 더욱 줄일 수 있으며, 이로 인해 최종 출력 품질도 저하될 수 있다는 주의가 필요합니다. 비교 평가에서는 Stable Cascade가 비교한 거의 모든 모델에 비해 빠른 정렬과 미적 품질 측면에서 가장 좋은 성능을 보였습니다. 아래 그림은 부분 프롬프트와 미적 프롬프트를 혼합하여 인간이 평가한 결과를 보여줍니다. Stable Cascade(30 추론 단계) vs. Playground v2(50 추론 단계), SDXL(50 추론 단계) , SDXL Turbo(1 추론 단계) 및 Würstchen V2(30 추론 단계)를 비교합니다. Stable Cascade, SDXL, Playground V2 및 SDXL Turbo Stable Cascade의 효율성에 대한 초점은 아키텍처와 더 높은 압축 가능성. 가장 큰 모델이 Stable Diffusion XL보다 1.4B 더 많은 매개변수를 갖고 있음에도 불구하고 추론 시간은 여전히 더 빠릅니다. 추가된 기능 Stable Cascade는 표준 텍스트-이미지 생성 외에도 이미지 변형 및 이미지-이미지 생성도 생성할 수 있습니다. 주어진 이미지에 노이즈를 추가한 다음 시작점으로 이미지를 생성하는 방식으로 이미지를 이미지로 변환합니다. 아래는 왼쪽 이미지에 노이즈를 추가한 다음 거기에서 노이즈를 생성하는 예입니다. Stable Cascade 출시와 함께 Stability AI는 훈련, 미세 조정, ControlNet 및 LoRA용 모든 코드를 공개하여 추가 실험에 대한 요구 사항을 줄입니다. 이 아키텍처로. 다음은 모델과 함께 출시될 일부 ControlNet입니다. Canny Edge: 모델에 입력된 기존 이미지의 가장자리를 기반으로 새로운 이미지를 생성합니다. Stability AI 테스트에 따르면 스케치 크기를 조정할 수도 있습니다.型 型 상단은 입력 모델의 스케치, 하단은 출력 결과 2x 초해상도: 이미지의 해상도를 측면 길이의 2배로 늘리는 것(예: 1024 x 1024 이미지를 2048 x 2048 출력으로 변환)은 단계 C에서 생성된 잠재 표현에도 사용할 수 있습니다. 이 가격 대비 가치가 마음에 드시나요? 훈련, 미세 조정, ControlNet 및 LoRA용 코드
위 내용은 생성 속도는 SDXL보다 두 배 빠르며 9GB GPU에서도 실행될 수 있어 가격 대비 성능 비율이 향상되었습니다.의 상세 내용입니다. 자세한 내용은 PHP 중국어 웹사이트의 기타 관련 기사를 참조하세요!

핫 AI 도구

Undresser.AI Undress
사실적인 누드 사진을 만들기 위한 AI 기반 앱

AI Clothes Remover
사진에서 옷을 제거하는 온라인 AI 도구입니다.

Undress AI Tool
무료로 이미지를 벗다

Clothoff.io
AI 옷 제거제

AI Hentai Generator
AI Hentai를 무료로 생성하십시오.

인기 기사

뜨거운 도구

메모장++7.3.1
사용하기 쉬운 무료 코드 편집기

SublimeText3 중국어 버전
중국어 버전, 사용하기 매우 쉽습니다.

스튜디오 13.0.1 보내기
강력한 PHP 통합 개발 환경

드림위버 CS6
시각적 웹 개발 도구

SublimeText3 Mac 버전
신 수준의 코드 편집 소프트웨어(SublimeText3)

뜨거운 주제









하지만 공원에 있는 노인을 이길 수는 없을까요? 파리올림픽이 본격화되면서 탁구가 많은 주목을 받고 있다. 동시에 로봇은 탁구 경기에서도 새로운 돌파구를 마련했습니다. 방금 DeepMind는 탁구 경기에서 인간 아마추어 선수 수준에 도달할 수 있는 최초의 학습 로봇 에이전트를 제안했습니다. 논문 주소: https://arxiv.org/pdf/2408.03906 DeepMind 로봇은 탁구를 얼마나 잘 치나요? 아마도 인간 아마추어 선수들과 동등할 것입니다: 포핸드와 백핸드 모두: 상대는 다양한 플레이 스타일을 사용하고 로봇도 견딜 수 있습니다: 다양한 스핀으로 서브를 받습니다. 그러나 게임의 강도는 그만큼 강렬하지 않은 것 같습니다. 공원에 있는 노인. 로봇용, 탁구용

8월 21일, 2024년 세계로봇대회가 베이징에서 성대하게 개최되었습니다. SenseTime의 홈 로봇 브랜드 "Yuanluobot SenseRobot"은 전체 제품군을 공개했으며, 최근에는 Yuanluobot AI 체스 두는 로봇인 체스 프로페셔널 에디션(이하 "Yuanluobot SenseRobot")을 출시하여 세계 최초의 A 체스 로봇이 되었습니다. 집. Yuanluobo의 세 번째 체스 게임 로봇 제품인 새로운 Guoxiang 로봇은 AI 및 엔지니어링 기계 분야에서 수많은 특별한 기술 업그레이드와 혁신을 거쳤으며 처음으로 3차원 체스 말을 집는 능력을 실현했습니다. 가정용 로봇의 기계 발톱을 통해 체스 게임, 모두 체스 게임, 기보 복습 등과 같은 인간-기계 기능을 수행합니다.

개학이 코앞으로 다가왔습니다. 새 학기를 앞둔 학생들뿐만 아니라 대형 AI 모델도 스스로 관리해야 합니다. 얼마 전 레딧에는 클로드가 게으르다고 불평하는 네티즌들이 붐볐습니다. "레벨이 많이 떨어졌고, 자주 멈췄고, 심지어 출력도 매우 짧아졌습니다. 출시 첫 주에는 4페이지 전체 문서를 한 번에 번역할 수 있었지만 지금은 반 페이지도 출력하지 못합니다. !" https://www.reddit.com/r/ClaudeAI/comments/1by8rw8/something_just_feels_wrong_with_claude_in_the/ "클로드에게 완전히 실망했습니다"라는 제목의 게시물에

베이징에서 열린 세계로봇컨퍼런스에서는 휴머노이드 로봇의 전시가 현장의 절대 화두가 됐다. 스타더스트 인텔리전트 부스에서는 AI 로봇 어시스턴트 S1이 덜시머, 무술, 서예 3대 퍼포먼스를 선보였다. 문학과 무술을 모두 갖춘 하나의 전시 공간은 수많은 전문 관객과 미디어를 끌어 모았습니다. 탄력 있는 현의 우아한 연주를 통해 S1은 정밀한 작동과 속도, 힘, 정밀성을 갖춘 절대적인 제어력을 보여줍니다. CCTV 뉴스는 '서예'의 모방 학습 및 지능형 제어에 대한 특별 보도를 진행했습니다. 회사 설립자 Lai Jie는 부드러운 움직임 뒤에 하드웨어 측면이 최고의 힘 제어와 가장 인간과 유사한 신체 지표(속도, 하중)를 추구한다고 설명했습니다. 등)이지만 AI측에서는 사람의 실제 움직임 데이터를 수집해 로봇이 강한 상황에 직면했을 때 더욱 강해지고 빠르게 진화하는 방법을 학습할 수 있다. 그리고 민첩하다

비전과 로봇 학습의 긴밀한 통합. 최근 화제를 모으고 있는 1X 휴머노이드 로봇 네오(NEO)와 두 개의 로봇 손이 원활하게 협력해 옷 개기, 차 따르기, 신발 싸기 등을 하는 모습을 보면 마치 로봇 시대로 접어들고 있다는 느낌을 받을 수 있다. 실제로 이러한 부드러운 움직임은 첨단 로봇 기술 + 정교한 프레임 디자인 + 다중 모드 대형 모델의 산물입니다. 우리는 유용한 로봇이 종종 환경과 복잡하고 절묘한 상호작용을 요구한다는 것을 알고 있으며, 환경은 공간적, 시간적 영역에서 제약으로 표현될 수 있습니다. 예를 들어, 로봇이 차를 따르도록 하려면 먼저 로봇이 찻주전자 손잡이를 잡고 차를 흘리지 않고 똑바로 세운 다음, 주전자 입구와 컵 입구가 일치할 때까지 부드럽게 움직여야 합니다. 을 누른 다음 주전자를 특정 각도로 기울입니다. 이것

참가자들은 이번 ACL 컨퍼런스에서 많은 것을 얻었습니다. ACL2024는 6일간 태국 방콕에서 개최됩니다. ACL은 전산언어학 및 자연어 처리 분야 최고의 국제학술대회로 국제전산언어학회(International Association for Computational Linguistics)가 주최하고 매년 개최된다. ACL은 NLP 분야에서 학술 영향력 1위를 항상 차지하고 있으며, CCF-A 추천 컨퍼런스이기도 합니다. 올해로 62회째를 맞이하는 ACL 컨퍼런스에는 NLP 분야의 최신 저서가 400편 이상 접수됐다. 어제 오후 컨퍼런스에서는 최우수 논문과 기타 상을 발표했습니다. 이번에 최우수논문상 7개(미출판 2개), 우수주제상 1개, 우수논문상 35개가 있다. 이 컨퍼런스에서는 또한 3개의 리소스 논문상(ResourceAward)과 사회적 영향상(Social Impact Award)을 수상했습니다.

오늘 오후 Hongmeng Zhixing은 공식적으로 새로운 브랜드와 신차를 환영했습니다. 8월 6일, Huawei는 Hongmeng Smart Xingxing S9 및 Huawei 전체 시나리오 신제품 출시 컨퍼런스를 개최하여 파노라마식 스마트 플래그십 세단 Xiangjie S9, 새로운 M7Pro 및 Huawei novaFlip, MatePad Pro 12.2인치, 새로운 MatePad Air, Huawei Bisheng을 선보였습니다. 레이저 프린터 X1 시리즈, FreeBuds6i, WATCHFIT3 및 스마트 스크린 S5Pro를 포함한 다양한 새로운 올-시나리오 스마트 제품, 스마트 여행, 스마트 오피스, 스마트 웨어에 이르기까지 화웨이는 풀 시나리오 스마트 생태계를 지속적으로 구축하여 소비자에게 스마트한 경험을 제공합니다. 만물인터넷. Hongmeng Zhixing: 스마트 자동차 산업의 업그레이드를 촉진하기 위한 심층적인 권한 부여 화웨이는 중국 자동차 산업 파트너와 손을 잡고

Machine Power Report 편집자: Yang Wen 대형 모델과 AIGC로 대표되는 인공지능의 물결은 우리가 살고 일하는 방식을 조용히 변화시키고 있지만, 대부분의 사람들은 여전히 그것을 어떻게 사용하는지 모릅니다. 이에 직관적이고 흥미롭고 간결한 인공지능 활용 사례를 통해 AI 활용 방법을 자세히 소개하고 모두의 사고를 자극하고자 'AI in Use' 칼럼을 론칭하게 됐다. 또한 독자들이 혁신적인 실제 사용 사례를 제출하는 것을 환영합니다. 맙소사 AI가 정말 천재가 되었네요. 최근에는 AI가 생성한 사진의 진위 판별이 어렵다는 점이 화제가 되고 있다. (자세한 내용은 AI 사용 | 3단계로 AI 미녀 되기, 1초 만에 AI에 의해 원래 모습으로 돌아가기 참조) 인터넷에서 인기 있는 AI Google lady 외에도 다양한 FLUX 생성기가 있습니다. 소셜 플랫폼에 등장
