국내 최초 뮤직 SOTA 모델 등장! 중국어에 최적화되어 있으며 무료로 사용 가능하며 장르 제한이 없습니다.
"Tiangong" 대형 모델 출시 1주년을 맞아 Kunlun Worldwide는 "Tiangong 3.0" 기본 모델과 "Tiangong SkyMusic" 음악 모델이 공식 베타 버전을 출시했다고 발표했습니다.
AI를 통해 인간은 음악 창작의 자유를 누릴 수 있기 때문에 다툼도 재미있어졌습니다.
과거 X 플랫폼의 유명한 AI 블로거 Aran Komatsuzaki는 다른 AI 과학자인 Gary Marcus에 대한 불만을 표현하기 위해 특별히 노래를 썼고 현재 인기 있는 Suno를 사용하여 생성했습니다. 아시다시피 과거에는 이 거물들 사이의 말싸움은 주로 게시물을 올리는 것이었고 그 다음에는 당신과 내가 후속 조치를 취했습니다. 이번 고마츠자키 아란의 접근 방식은 "고마워요, 고마워요, 디스하고 싶어요"에서 영감을 얻은 것인지도 모르겠습니다.
고마츠자키 아란처럼 음악을 알지만 음악은 모르는 국내외 많은 사람들이 Suno와 같은 AI 음악 창작 도구를 사용하려고 노력하고 있으며 매우 흥미로운 음악 작품을 많이 만들어냈습니다.
그러나 많은 네티즌들은 Suno가 때때로 불안정한 중국어를 생성하고, 중국어 노래가 영어 느낌이 나고, 특이한 단어가 잘못 부르는 등의 문제가 있다고 보고했습니다.
영상주소 : https://b23.tv/gVqTUOu
그럼 특별히 중국어에 최적화된 AI 음악생성 모델이 있을까요?
오늘 Kunlun Wanwei가 공개 베타를 위해 사회 전체에 공개한 "Tiangong SkyMusic"이 바로 그러한 모델입니다. 그것이 생성하는 중국 보컬은 명확하고 정통하며 비정상적인 소리가 없으며 "브로드웨이 스타일 중국 노래"와 같은 적응 문제가 없습니다. 게다가 중국어에 최적화되어 있을 뿐만 아니라 광둥어, 청두어, 베이징어 등의 방언도 처리합니다.
그럼 Suno에 비해 SkyMusic의 성능은 어떤가요? 수평적 평가 데이터에 따르면 SkyMusic은 보컬 및 BGM 음질, 보컬의 자연성, 발음 명료도 등 여러 지표에서 우수한 것으로 나타났습니다. 종합적인 성능은 Suno V3를 능가하며 중국 최초의 음악 AIGC SOTA 모델이기도 합니다. 모델 기술은 AIGC 분야 최초로 세계를 선도합니다.
이러한 뛰어난 성능은 강력한 기본 모델, 즉 Kunlun Wanwei가 동시에 출시하고 오픈 소스로 공개한 대형 모델 "Tiangong 3.0"과 자연스럽게 분리될 수 없습니다. 이 모델은 4,000억 개의 매개변수를 갖고 있으며, 이는 3,140억 개의 매개변수로 Grok-1을 능가하며 세계 최대 오픈 소스 MoE 모델입니다.
MMBench 등 다수의 권위 있는 다중 모드 평가 결과에서 'Tiangong 3.0'은 GPT-4V를 능가하며 세계 1위를 차지했습니다.
이 기본 모델의 지원으로 SkyMusic은 노래에 대한 더 깊은 이해를 갖게 되었습니다. 가사를 통해 감정의 변화를 조절할 수 있고, 비브라토, 오페라, 챈팅 등 다양한 창법을 구현해 생성된 음악 작품을 더욱 감성적으로 풍부하고 상황에 맞게 만들어준다.
그럼 이 모델은 어떻게 사용하나요? 기술적 경로는 무엇입니까? "Tiangong 3.0"의 혁신은 무엇입니까? 하나씩 살펴보겠습니다.
무제한 게임 플레이가 가능한 국내 최초의 음악 SOTA 모델
실제로 SkyMusic을 사용하여 노래를 생성하는 것은 매우 간단합니다. 노래 제목과 가사를 입력하고 참조 트랙을 선택하기만 하면 유사한 스타일과 보컬을 가진 노래가 생성됩니다.
가사를 직접 쓰고 싶지 않다면 입력창 오른쪽 하단에 있는 "AI 작사" 기능을 사용해 보세요. 첫 문장부터 작성할 수 있으며, 한 번에 한 문장만 생성되며, 노래 전체가 완성될 때까지 만족스럽지 못한 문장은 시간 내에 삭제할 수 있습니다.
물론 "Tiangong 3.0"을 사용하여 노래를 작성할 수도 있습니다. 예를 들어 이 노래 "This Site"는 "Tiangong 3.0"을 사용하여 작성되었습니다.
다음 단계는 다음과 같습니다. 참조 곡을 선택하는 것은 SkyMusic의 고유한 기능이기도 합니다. 즉, 샘플 음원을 기반으로 음악을 생성할 수 있습니다.
이 단계에서 SkyMusic은 다양한 참조 트랙을 제공하며, 그 중에서 선택하거나 노래 파일을 업로드하도록 선택할 수 있습니다. 여기서는 생성 효과가 어떤지 확인하기 위해 Luo Tianyi의 노래를 업로드했습니다. 샘플 음원을 기반으로 음악을 생성하는 이 기능은 SkyMusic의 게임 플레이를 크게 향상시켰습니다. 사용자 작품 전시 영역에서는 '신인'(영화 '주추삼악'의 에피소드)에 고대 록과 DJ를 포함한 5가지 버전이 있음을 알 수 있습니다.
시험 과정에서 우리는 실제로 SkyMusic에서 생성한 음악이 랩, 포크, 펑크, 고대 스타일, 일렉트로닉 및 기타 장르를 포괄한다는 사실도 발견했습니다. 다음 단계에서는 사용자가 흥얼거리는 멜로디를 기반으로 노래를 생성할 수 있도록 허용할 계획이며 이는 전문가에게 큰 도움이 될 것입니다.
현재 Tiangong SkyMusic은 "Tiangong" 앱을 다운로드하여 체험하실 수 있습니다. 이는 중국에서 유일하게 공개된 대규모 AI 음악 생성 모델이며, 이 모델의 등장으로 이 분야에서 국내 AIGC 도구의 공백을 메울 수 있습니다.
이 모델은 아직 초기 단계이지만 이미 많은 사람들에게 음악 창작의 즐거움을 경험할 수 있게 해주었습니다. 모든 사람이 이를 사용하여 신극을 변형하고, 두 번째 히트작을 만들고, 교육을 지원하기 위해 고대 시를 다시 쓰고, 음악 창작을 위한 다양하고 새로운 방향을 개발합니다.
자체 개발한 Sora 아키텍처, 기술 로드맵이 공개되었습니다
Tiangong SkyMusic은 엔드 투 엔드 음악 생성 모델이므로 사용하기가 매우 간단하다고 느낍니다. 그러나 전체 모델의 개발은 그렇게 간단하지 않습니다.
먼저 기술적 관점에서 SkyMusic은 대형 모델 음악 오디오 생성 경로를 선택했습니다. 즉, 악보를 생성하기 위해 상징적인 음악 생성 경로(예: MIDI)를 사용하는 대신 오디오 파형을 직접 학습하고 생성한다는 의미입니다. 이 접근 방식을 사용하면 악기, 보컬, 멜로디, 볼륨, 음표 등과 같은 요소의 통합된 엔드투엔드 생성이 가능하여 보다 직접적이고 고품질의 음악 제작 경험을 제공할 수 있습니다. 하지만 이 방향은 더욱 어렵고 높은 컴퓨팅 파워와 자금이 필요하기 때문에 이를 실천하는 사람이 거의 없습니다.
게다가 이 방향에서는 참고할만한 공개 정보나 오픈 소스 모델이 거의 없기 때문에 대부분의 연구는 보컬이 아닌 BGM 분야에 집중됩니다. 이전에. .
이런 압박에도 불구하고 Kunlun Wanwei는 수많은 연구 개발 실험을 수행하고 많은 컴퓨팅 성능을 투자했으며 2천만 곡(인류 역사상 가장 큰 음악 데이터 세트)이 포함된 데이터 세트를 구축하고 마침내 효과를 탐색했습니다. 해결책. 또한 이 솔루션의 기술 개략도도 공개했습니다.
Tiangong SkyMusic 기술 도식 다이어그램: 대규모 Transformer는 음악 제어성을 달성하는 동시에 음악 패치의 상황별 종속성을 학습하기 위해 음악을 작곡하는 역할을 담당하며 노래를 부르고 LDM을 통해 음악 패치를 복원할 수 있도록 합니다. 고품질 오디오로. 이 모델 아키텍처는 비디오, 오디오 및 음악을 처리할 때 매우 잘 작동합니다.
사진에서 볼 수 있듯이 스카이뮤직의 프레임워크는 소라와 비슷한 DiT 기술 경로지만, 개발 시기는 소라가 나오기 전이었기 때문에 많은 함정을 밟을 수밖에 없습니다.
업계에서는 이 도식 다이어그램이 매우 중요합니다. SUNO를 포함하여 기술 경로를 공개한 대규모 AI 음악 모델 회사가 시장에 없기 때문에 Kunlun Wanwei가 유일한 회사이기 때문입니다.
뒤에 있는 강력한 기반 - Tiangong 3.0
SkyMusic의 성공은 그 뒤에 있는 기본 모델인 Tiangong 3.0과 뗄래야 뗄 수 없는 관계입니다. 핵심 업그레이드는 "독립적 사고"에 반영됩니다. 이는 모델의 새로운 다중 라운드 검색 및 포괄적인 도구 호출, 차트 그리기, 연구 모드, 향상 모드 및 기타 기능에 반영됩니다.
데이터 통계 작업을 수행하면 모든 데이터를 수집하는 데 도움이 될 수 있을 뿐만 아니라 자신만의 코드를 작성하고 다양한 함수를 호출하여 차트를 그릴 수도 있습니다. 각 중간 단계는 명확하게 해체되었으며, 후속 실행에는 "라벨 중복 방지" 및 "텍스트 표시 중앙 정렬"과 같은 세부 사항도 고려되었습니다. 이것은 "독립적 사고"능력의 구체화입니다.
이러한 "독립적 사고" 능력의 향상은 의미 이해, 논리적 추론 및 기타 측면에서 "Tiangong 3.0"의 최적화와 불가분의 관계입니다. 이전 세대의 "Tiangong 2.0" MoE 대형 모델에 비해 "Tiangong 3.0"은 모델 의미 이해, 논리적 추론, 다양성, 일반화, 불확실성 지식, 학습 능력 등의 영역에서 놀라운 성능 향상을 보였습니다. 20% 이상 향상되었으며, 수학/추론/코딩/문화 및 창의적 능력이 30% 이상 향상되었습니다.
검색 작업을 예로 들어보세요. "검색 강화" 모드에서 간단한 검색 요청을 하면 "Tiangong 3.0"은 요약 답변을 제공할 뿐만 아니라 일부 중요한 정보를 차트로 세분화합니다.
"Research" 모드에서는 Query에 언급되지 않은 확장 질문에 대해 토론하고 검색할 수 있는 "심층 연구" 모듈도 제공되어 마치 논문을 읽는 듯한 느낌을 줍니다. 마지막으로, 빠른 참조를 위해 이 정보를 마인드 맵으로 구성합니다.
의미론적 이해와 논리적 추론 능력의 획기적인 향상을 바탕으로 "Tiangong 3.0"은 모델이 외부 도구와 정보를 독립적으로 계획하고 호출하고 결합하는 능력에 대한 특별 교육도 수행했습니다. 외부 도구와 정보를 독립적으로 계획하고 호출하고 결합함으로써 산업 연구, 제품 리뷰, 정보 분석 등 다양하고 복잡한 요구 사항을 정확하고 효율적으로 완료하는 데 도움이 될 수 있습니다.
이 독립적인 사고 능력은 대규모 인공 지능 모델에 매우 중요합니다. 첫째, 이 기능을 통해 AI는 직접적인 지시 없이도 자율적인 추론을 수행하여 복잡한 문제를 처리하는 능력을 향상할 수 있습니다. 둘째, 독립적으로 생각하는 AI 모델은 개인화된 시나리오 기반 요구 사항을 충족하는 혁신적인 솔루션을 설계할 수 있습니다. AI는 새로운 환경이나 변화하는 환경에 직면할 때 자체 학습 및 적응을 통해 지속적으로 성능을 최적화할 수 있습니다. 이 세 가지 측면의 누적 효과는 AI 기술 적용의 폭과 깊이를 크게 촉진하여 다양한 실제 응용 분야에서 AI 기술을 더욱 지능적이고 효율적으로 만들었습니다.
"Tiangong 3.0"에는 AI 음악, AI 검색, AI 글쓰기, AI 페인팅 등 다양한 대형 모델 기능이 포함되어 있습니다. 4000억 매개변수 MoE 대형 모델 "Tiangong 3.0"과 Tiangong SkyMusic의 관계에 대해 이야기하면 Kunlun Fang 한완웨이 회장 겸 CEO는 “AI 기반 대형 모델이 AIGC의 탄탄한 기반이라는 것은 누구나 알고 있으며, 특히 텍스트 대형 모델의 경우 빈센트 픽쳐, 빈센트 뮤직, 빈센트 비디오(이러한 AIGC 모델)의 역량이 뛰어나다”고 설명했다. 텍스트 모델 기반입니다. 텍스트 모델 기능이 충분하지 않으면 AIGC 기능이 크게 제한됩니다."
이 효과는 "Tiangong 3.0"의 AI 페인팅 및 기타 기능에도 반영됩니다. 'Tiangong 3.0'에는 이미지 크기 확장, 이미지 방향 조정, 매트 이미지 생성, 매트 이미지 진화, 매트 이미지 확장 등의 새로운 기능이 추가되었으며 실제 테스트 결과가 뛰어납니다.
"저희 4000억 대형 모델은 당사의 모든 C-end 제품을 지원하는 기본 모델입니다. 저의 기본 모델이 좋을수록 저의 음악, 게임, 영상, 애니메이션 제품도 더 좋아질 것입니다. 더 잘하세요. 그래서 우리는 대형 기본 모델을 만들려는 매우 강한 동기를 갖고 있습니다."라고 Fang Han은 말했습니다.
일반 인공 지능 달성,
모든 사람이 자신을 더 잘 형성하고 표현하도록 하세요
AGI의 비전에서 일부 AI 회사 경영진은 AI 도구를 사용하여 인간 사회의 생산성과 효율성을 향상시키고 싶다고 언급하는 것을 자주 듣습니다. . 따라서 그들은 주로 모델 지능의 확장 및 향상에 중점을 둡니다. 그러나 Fang Han의 관점에서는 중요한 문제, 즉 AI를 사용하여 사람들이 감정을 더 잘 이해하고 표현하도록 돕는 방법을 간과했습니다.
스카이뮤직의 음악섹션에서는 졸업을 앞둔 학생들의 슬픔, 사랑을 할 수 없는 청년들의 슬픔, 가족을 부양하는 중년의 피로가 모두 노래를 통해 표현되는 사례를 많이 봤습니다. . 이것이 바로 '자신의 야망을 표현하는 노래'이다.
방언에 대한 지원은 일종의 문화적 평등에 가깝고 Fang Han이 매우 중요하게 생각하는 것입니다. 앞으로는 더 많은 언어를 추가해 작은 언어를 사용하는 모든 사람이 자신만의 문화 콘텐츠를 쉽게 만들 수 있도록 하겠다.
"AIGC 분야에서 우리의 야심찬 목표는 전 세계 모든 사람이 동등하게 콘텐츠를 만들 수 있기를 바라는 것입니다. 우리는 모든 사람이 자신을 더 잘 형성하고 표현할 수 있도록 모든 사람의 창의적 문턱을 낮추고 싶습니다."
최근에는 이 내용이 Kunlun Worldwide의 최신 미션에도 쓰여졌습니다.
실제로 이러한 접근 방식은 상업적으로도 의미가 있습니다. Fang Han은 "모든 사람이 음악을 만들 수 있게 되면 모든 레스토랑, 바 등 모든 공공 장소에서 자신의 비즈니스 요구 사항에 맞는 배경 음악을 만들 수 있다고 믿습니다."라고 설명했습니다.
향후 지속적인 최적화와 개선을 통해 SkyMusic은 점차 모든 사람이 전문적이고 사용하기 쉬운 음악 제작 플랫폼으로 발전할 것입니다.
물론 Kunlun Wanwei의 노력은 음악에만 국한되지 않습니다. "Tiangong 3.0"을 기반으로 6개의 주요 AI 비즈니스 매트릭스를 형성했습니다. 미래에는 이러한 매트릭스가 AI UGC 플랫폼을 구성할 것입니다.
이 플랫폼은 일반 사람들이 자신을 표현하는 데 도움을 줄 수 있을 뿐만 아니라 AI를 사용하여 콘텐츠를 제작하려는 창작자가 IP 창작의 완전히 닫힌 루프를 완성하도록 도울 수 있습니다. 이 폐쇄 루프는 '좋은 이야기(IP)'를 핵심으로 텍스트, 만화, 음악, 비디오 등 다양한 형태를 포괄하며, 소비자의 콘텐츠 소비도 이 플랫폼에서 완성됩니다.
"우리의 본질은 더 많은 사람들이 창작자 팀에 합류할 수 있도록 하는 것입니다. 전제는 좋은 이야기를 할 수 있어야 한다는 것입니다. 좋은 IP를 만들 수 있다면 콘텐츠를 만들 수 있다는 것은 예측 가능합니다. 모든 콘텐츠 산업이 재편될 것이며, 창작자 수도 수백 배로 늘어날 것이고, 소비할 수 있는 콘텐츠도 백배로 늘어날 것입니다. 이는 또한 우리의 "All in AGI 및 AIGC" 전략의 논리이기도 합니다. .
이 시대는 어떤 모습으로 변할 것인가? 두고 보자.
위 내용은 국내 최초 뮤직 SOTA 모델 등장! 중국어에 최적화되어 있으며 무료로 사용 가능하며 장르 제한이 없습니다.의 상세 내용입니다. 자세한 내용은 PHP 중국어 웹사이트의 기타 관련 기사를 참조하세요!

핫 AI 도구

Undresser.AI Undress
사실적인 누드 사진을 만들기 위한 AI 기반 앱

AI Clothes Remover
사진에서 옷을 제거하는 온라인 AI 도구입니다.

Undress AI Tool
무료로 이미지를 벗다

Clothoff.io
AI 옷 제거제

AI Hentai Generator
AI Hentai를 무료로 생성하십시오.

인기 기사

뜨거운 도구

메모장++7.3.1
사용하기 쉬운 무료 코드 편집기

SublimeText3 중국어 버전
중국어 버전, 사용하기 매우 쉽습니다.

스튜디오 13.0.1 보내기
강력한 PHP 통합 개발 환경

드림위버 CS6
시각적 웹 개발 도구

SublimeText3 Mac 버전
신 수준의 코드 편집 소프트웨어(SublimeText3)

뜨거운 주제











하지만 공원에 있는 노인을 이길 수는 없을까요? 파리올림픽이 본격화되면서 탁구가 많은 주목을 받고 있다. 동시에 로봇은 탁구 경기에서도 새로운 돌파구를 마련했습니다. 방금 DeepMind는 탁구 경기에서 인간 아마추어 선수 수준에 도달할 수 있는 최초의 학습 로봇 에이전트를 제안했습니다. 논문 주소: https://arxiv.org/pdf/2408.03906 DeepMind 로봇은 탁구를 얼마나 잘 치나요? 아마도 인간 아마추어 선수들과 동등할 것입니다: 포핸드와 백핸드 모두: 상대는 다양한 플레이 스타일을 사용하고 로봇도 견딜 수 있습니다: 다양한 스핀으로 서브를 받습니다. 그러나 게임의 강도는 그만큼 강렬하지 않은 것 같습니다. 공원에 있는 노인. 로봇용, 탁구용

8월 21일, 2024년 세계로봇대회가 베이징에서 성대하게 개최되었습니다. SenseTime의 홈 로봇 브랜드 "Yuanluobot SenseRobot"은 전체 제품군을 공개했으며, 최근에는 Yuanluobot AI 체스 두는 로봇인 체스 프로페셔널 에디션(이하 "Yuanluobot SenseRobot")을 출시하여 세계 최초의 A 체스 로봇이 되었습니다. 집. Yuanluobo의 세 번째 체스 게임 로봇 제품인 새로운 Guoxiang 로봇은 AI 및 엔지니어링 기계 분야에서 수많은 특별한 기술 업그레이드와 혁신을 거쳤으며 처음으로 3차원 체스 말을 집는 능력을 실현했습니다. 가정용 로봇의 기계 발톱을 통해 체스 게임, 모두 체스 게임, 기보 복습 등과 같은 인간-기계 기능을 수행합니다.

개학이 코앞으로 다가왔습니다. 새 학기를 앞둔 학생들뿐만 아니라 대형 AI 모델도 스스로 관리해야 합니다. 얼마 전 레딧에는 클로드가 게으르다고 불평하는 네티즌들이 붐볐습니다. "레벨이 많이 떨어졌고, 자주 멈췄고, 심지어 출력도 매우 짧아졌습니다. 출시 첫 주에는 4페이지 전체 문서를 한 번에 번역할 수 있었지만 지금은 반 페이지도 출력하지 못합니다. !" https://www.reddit.com/r/ClaudeAI/comments/1by8rw8/something_just_feels_wrong_with_claude_in_the/ "클로드에게 완전히 실망했습니다"라는 제목의 게시물에

베이징에서 열린 세계로봇컨퍼런스에서는 휴머노이드 로봇의 전시가 현장의 절대 화두가 됐다. 스타더스트 인텔리전트 부스에서는 AI 로봇 어시스턴트 S1이 덜시머, 무술, 서예 3대 퍼포먼스를 선보였다. 문학과 무술을 모두 갖춘 하나의 전시 공간은 수많은 전문 관객과 미디어를 끌어 모았습니다. 탄력 있는 현의 우아한 연주를 통해 S1은 정밀한 작동과 속도, 힘, 정밀성을 갖춘 절대적인 제어력을 보여줍니다. CCTV 뉴스는 '서예'의 모방 학습 및 지능형 제어에 대한 특별 보도를 진행했습니다. 회사 설립자 Lai Jie는 부드러운 움직임 뒤에 하드웨어 측면이 최고의 힘 제어와 가장 인간과 유사한 신체 지표(속도, 하중)를 추구한다고 설명했습니다. 등)이지만 AI측에서는 사람의 실제 움직임 데이터를 수집해 로봇이 강한 상황에 직면했을 때 더욱 강해지고 빠르게 진화하는 방법을 학습할 수 있다. 그리고 민첩하다

참가자들은 이번 ACL 컨퍼런스에서 많은 것을 얻었습니다. ACL2024는 6일간 태국 방콕에서 개최됩니다. ACL은 전산언어학 및 자연어 처리 분야 최고의 국제학술대회로 국제전산언어학회(International Association for Computational Linguistics)가 주최하고 매년 개최된다. ACL은 NLP 분야에서 학술 영향력 1위를 항상 차지하고 있으며, CCF-A 추천 컨퍼런스이기도 합니다. 올해로 62회째를 맞이하는 ACL 컨퍼런스에는 NLP 분야의 최신 저서가 400편 이상 접수됐다. 어제 오후 컨퍼런스에서는 최우수 논문과 기타 상을 발표했습니다. 이번에 최우수논문상 7개(미출판 2개), 우수주제상 1개, 우수논문상 35개가 있다. 이 컨퍼런스에서는 또한 3개의 리소스 논문상(ResourceAward)과 사회적 영향상(Social Impact Award)을 수상했습니다.

오늘 오후 Hongmeng Zhixing은 공식적으로 새로운 브랜드와 신차를 환영했습니다. 8월 6일, Huawei는 Hongmeng Smart Xingxing S9 및 Huawei 전체 시나리오 신제품 출시 컨퍼런스를 개최하여 파노라마식 스마트 플래그십 세단 Xiangjie S9, 새로운 M7Pro 및 Huawei novaFlip, MatePad Pro 12.2인치, 새로운 MatePad Air, Huawei Bisheng을 선보였습니다. 레이저 프린터 X1 시리즈, FreeBuds6i, WATCHFIT3 및 스마트 스크린 S5Pro를 포함한 다양한 새로운 올-시나리오 스마트 제품, 스마트 여행, 스마트 오피스, 스마트 웨어에 이르기까지 화웨이는 풀 시나리오 스마트 생태계를 지속적으로 구축하여 소비자에게 스마트한 경험을 제공합니다. 만물인터넷. Hongmeng Zhixing: 스마트 자동차 산업의 업그레이드를 촉진하기 위한 심층적인 권한 부여 화웨이는 중국 자동차 산업 파트너와 손을 잡고

비전과 로봇 학습의 긴밀한 통합. 최근 화제를 모으고 있는 1X 휴머노이드 로봇 네오(NEO)와 두 개의 로봇 손이 원활하게 협력해 옷 개기, 차 따르기, 신발 싸기 등을 하는 모습을 보면 마치 로봇 시대로 접어들고 있다는 느낌을 받을 수 있다. 실제로 이러한 부드러운 움직임은 첨단 로봇 기술 + 정교한 프레임 디자인 + 다중 모드 대형 모델의 산물입니다. 우리는 유용한 로봇이 종종 환경과 복잡하고 절묘한 상호작용을 요구한다는 것을 알고 있으며, 환경은 공간적, 시간적 영역에서 제약으로 표현될 수 있습니다. 예를 들어, 로봇이 차를 따르도록 하려면 먼저 로봇이 찻주전자 손잡이를 잡고 차를 흘리지 않고 똑바로 세운 다음, 주전자 입구와 컵 입구가 일치할 때까지 부드럽게 움직여야 합니다. 을 누른 다음 주전자를 특정 각도로 기울입니다. 이것

Machine Power Report 편집자: Yang Wen 대형 모델과 AIGC로 대표되는 인공지능의 물결은 우리가 살고 일하는 방식을 조용히 변화시키고 있지만, 대부분의 사람들은 여전히 그것을 어떻게 사용하는지 모릅니다. 이에 직관적이고 흥미롭고 간결한 인공지능 활용 사례를 통해 AI 활용 방법을 자세히 소개하고 모두의 사고를 자극하고자 'AI in Use' 칼럼을 론칭하게 됐다. 또한 독자들이 혁신적인 실제 사용 사례를 제출하는 것을 환영합니다. 맙소사 AI가 정말 천재가 되었네요. 최근에는 AI가 생성한 사진의 진위 판별이 어렵다는 점이 화제가 되고 있다. (자세한 내용은 AI 사용 | 3단계로 AI 미녀 되기, 1초 만에 AI에 의해 원래 모습으로 돌아가기 참조) 인터넷에서 인기 있는 AI Google lady 외에도 다양한 FLUX 생성기가 있습니다. 소셜 플랫폼에 등장
