OPPO는 GlyphDraw를 제안합니다: 한자가 포함된 이미지의 원클릭 생성, 이모티콘 출력을 위한 확산 모델
최근 몇 년 동안 텍스트 생성 이미지 분야에서 놀라운 혁신이 많이 이루어졌으며, 많은 모델이 텍스트 지침을 기반으로 고품질의 다양한 이미지를 생성할 수 있습니다. 생성된 이미지가 이미 매우 사실적임에도 불구하고 현재 모델은 일반적으로 풍경, 사물과 같은 물리적 이미지를 생성하는 데는 능숙하지만, 한자와 같은 복잡한 글리프 텍스트가 포함된 이미지와 같이 세부적으로 일관성이 높은 이미지를 생성하는 데 어려움을 겪습니다
이를 해결하려면 문제는 OPPO 및 기타 기관의 연구원들이 GlyphDraw라는 범용 학습 프레임워크를 제안한 것입니다. 이 프레임워크의 목표는 모델이 일관된 텍스트가 포함된 이미지를 생성할 수 있도록 하는 것입니다. 이 작품은 이미지 합성 분야에서 한자 생성 문제를 최초로 해결한 작품입니다
논문을 보려면 다음 링크를 클릭하세요: https://arxiv.org/abs/2303.17870
-
프로젝트 홈페이지 링크 : https://1073521013.github.io/glyph-draw.github.io/
전시장 경고 슬로건 생성 등 세대효과를 먼저 살펴보자 :
광고판 만들기:
사진에 간단한 텍스트 설명을 추가하고 텍스트 스타일도 다양화하세요.
또 다른 흥미롭고 실용적인 예는 이모티콘을 생성하는 것입니다.
결과에는 전반적으로 몇 가지 결함이 있지만 , 연구는 훌륭한 결과를 얻었습니다. 본 연구의 주요 기여는 다음과 같습니다.
본 연구는 GlyphDraw라는 한자 이미지 생성 프레임워크를 제안합니다. 전체 생성 과정에서 한자 글리프 및 위치와 같은 보조 정보를 사용하여 프레임워크가 세밀한 안내를 제공할 수 있으므로 생성된 한자 이미지를 고품질의 이미지에 원활하게 삽입할 수 있습니다
이것은 이 효과적인 훈련 전략은 사전 훈련된 모델에서 훈련 가능한 매개변수의 수를 제한함으로써 개방형 도메인 생성에서 모델의 강력한 성능을 성공적으로 유지하여 과적합과 치명적인 망각을 방지하고 한자 이미지를 정확하게 생성할 수 있습니다
훈련 데이터 세트를 구축하는 과정을 자세히 설명하고 한자 이미지 생성 품질을 평가하기 위한 새로운 기준 방법을 제안합니다. 그 중 GlyphDraw의 생성 정확도는 75%에 달했는데, 이는 이전 이미지 합성 방법보다 훨씬 뛰어났습니다
모델 소개:
먼저, 연구는 복잡한 이미지-텍스트 데이터 세트 구성 전략을 설계했습니다. . 그런 다음 오픈 소스 이미지 합성 알고리즘 Stable Diffusion을 사용하여 그림 2와 같이 일반적인 학습 프레임워크인 GlyphDraw를 제안합니다. stable 확산의 전반적인 훈련 목표는 다음 공식으로 표현될 수 있습니다.
GlyphDraw는 안정적 확산의 교차 주의 메커니즘입니다. 원본 입력의 잠재 벡터 z_t를 이미지의 잠재 벡터 z_t, 텍스트 마스크 l_m 및 글리프 이미지 l_g
로 계단식 교체를 수행합니다. 또한 도메인별 융합 모듈을 사용하여 조건 C 글리프와 텍스트 혼합 기능을 갖추고 있습니다. 텍스트 마스크 및 글리프 정보의 도입으로 전체 학습 프로세스에서 세분화된 확산 제어가 가능해졌습니다. 이는 모델 성능을 향상시키고 궁극적으로 한자 텍스트가 포함된 이미지를 생성할 수 있는 핵심 구성 요소입니다.
구체적으로 텍스트 정보의 픽셀 표현 , 특히 그림 문자와 같은 복잡한 텍스트 형식에서는 자연 물체와 명백한 차이가 있습니다. 예를 들어, 중국어 단어 "하늘"은 2차원 구조의 여러 획으로 구성되어 있으며 이에 상응하는 자연스러운 이미지는 "흰 구름이 점재하는 푸른 하늘"입니다. 그에 비해 한자는 매우 세밀하고 작은 움직임이나 변형으로도 텍스트가 잘못 렌더링되어 이미지 생성이 불가능할 수 있습니다
자연 이미지 배경에 문자를 삽입하려면 인접한 자연 이미지 픽셀에 영향을 주지 않고 텍스트 픽셀 생성을 정확하게 제어하는 핵심 문제도 고려해야 합니다. 저자는 자연스러운 이미지에 완벽한 한자를 표시하기 위해 위치 제어와 글리프 제어라는 두 가지 핵심 구성 요소를 확산 합성 모델에 통합하도록 설계했습니다.
다른 모델의 전역 조건부 입력과 달리 문자 생성에는 더 많은 요소가 필요합니다. 문자 픽셀의 잠재 특징 분포가 자연 이미지 픽셀의 분포와 매우 다르기 때문에 이미지의 특정 로컬 영역에 적용됩니다. 모델 학습이 무너지는 것을 방지하기 위해 본 연구에서는 세밀한 위치 영역 제어를 혁신적으로 제안하여 서로 다른 영역 간의 분포를 분리합니다
내용 재작성: 위치 제어 외에 또 다른 중요한 문제는 한자획의 합성입니다. . 한자의 복잡성과 다양성을 고려할 때, 명시적인 사전 지식 없이 대규모 이미지-텍스트 데이터 세트에서 학습하는 것은 매우 어렵습니다. 한자를 정확하게 생성하기 위해 본 연구에서는 모델의 확산 과정에 추가 조건 정보로 명시적 글리프 이미지를 도입합니다
원래 의미를 그대로 유지하려면 내용을 중국어로 다시 작성해야 합니다. 다음은 다시 작성된 내용입니다. 연구 설계 및 실험 결과
한자 이미지 생성을 위한 이전 데이터 세트가 없었기 때문에 본 연구에서는 먼저 정성적, 정량적 평가를 위한 벤치마크 데이터 세트인 ChineseDrawText를 만들었습니다. 이후 연구원들은 ChineseDrawText에서 여러 방법의 생성 정확도를 테스트하고 OCR 인식 모델을 통해 이를 평가했습니다
본 연구에서 제안한 GlyphDraw 모델은 보조 글리프와 위치 정보를 최대한 활용하여 평균 정확도를 달성했습니다. 75%의 비율로 모델의 캐릭터 이미지 생성 능력이 탁월함을 입증합니다. 아래 그림은 여러 방법의 시각적 비교 결과를 보여줍니다.
또한 GlyphDraw는 훈련 매개변수를 제한하여 개방형 도메인 이미지 합성 성능을 유지할 수도 있습니다. MS-COCO FID-10k에서는 일반 이미지 합성의 FID가 1만큼만 떨어졌습니다. 2.3

관심 있는 독자는 논문의 원문을 읽고 더 많은 연구 세부 사항을 알아볼 수 있습니다.
위 내용은 OPPO는 GlyphDraw를 제안합니다: 한자가 포함된 이미지의 원클릭 생성, 이모티콘 출력을 위한 확산 모델의 상세 내용입니다. 자세한 내용은 PHP 중국어 웹사이트의 기타 관련 기사를 참조하세요!

핫 AI 도구

Undresser.AI Undress
사실적인 누드 사진을 만들기 위한 AI 기반 앱

AI Clothes Remover
사진에서 옷을 제거하는 온라인 AI 도구입니다.

Undress AI Tool
무료로 이미지를 벗다

Clothoff.io
AI 옷 제거제

Video Face Swap
완전히 무료인 AI 얼굴 교환 도구를 사용하여 모든 비디오의 얼굴을 쉽게 바꾸세요!

인기 기사

뜨거운 도구

메모장++7.3.1
사용하기 쉬운 무료 코드 편집기

SublimeText3 중국어 버전
중국어 버전, 사용하기 매우 쉽습니다.

스튜디오 13.0.1 보내기
강력한 PHP 통합 개발 환경

드림위버 CS6
시각적 웹 개발 도구

SublimeText3 Mac 버전
신 수준의 코드 편집 소프트웨어(SublimeText3)

현대 제조업에서 정확한 결함 검출은 제품 품질을 보장하는 열쇠일 뿐만 아니라 생산 효율성을 향상시키는 핵심이기도 합니다. 그러나 기존 결함 감지 데이터세트는 실제 적용에 필요한 정확성과 의미론적 풍부함이 부족한 경우가 많아 모델이 특정 결함 카테고리나 위치를 식별할 수 없게 됩니다. 이 문제를 해결하기 위해 광저우 과학기술대학교와 Simou Technology로 구성된 최고 연구팀은 산업 결함에 대한 상세하고 의미론적으로 풍부한 대규모 주석을 제공하는 "DefectSpectrum" 데이터 세트를 혁신적으로 개발했습니다. 표 1에서 볼 수 있듯이, 다른 산업 데이터 세트와 비교하여 "DefectSpectrum" 데이터 세트는 가장 많은 결함 주석(5438개의 결함 샘플)과 가장 상세한 결함 분류(125개의 결함 카테고리)를 제공합니다.

오픈 LLM 커뮤니티는 백개의 꽃이 피어 경쟁하는 시대입니다. Llama-3-70B-Instruct, QWen2-72B-Instruct, Nemotron-4-340B-Instruct, Mixtral-8x22BInstruct-v0.1 등을 보실 수 있습니다. 훌륭한 연기자. 그러나 GPT-4-Turbo로 대표되는 독점 대형 모델과 비교하면 개방형 모델은 여전히 많은 분야에서 상당한 격차를 보이고 있습니다. 일반 모델 외에도 프로그래밍 및 수학을 위한 DeepSeek-Coder-V2, 시각 언어 작업을 위한 InternVL과 같이 핵심 영역을 전문으로 하는 일부 개방형 모델이 개발되었습니다.

Editor |KX 오늘날까지 단순한 금속부터 큰 막 단백질에 이르기까지 결정학을 통해 결정되는 구조적 세부 사항과 정밀도는 다른 어떤 방법과도 비교할 수 없습니다. 그러나 가장 큰 과제인 소위 위상 문제는 실험적으로 결정된 진폭에서 위상 정보를 검색하는 것입니다. 덴마크 코펜하겐 대학의 연구원들은 결정 위상 문제를 해결하기 위해 PhAI라는 딥러닝 방법을 개발했습니다. 수백만 개의 인공 결정 구조와 그에 상응하는 합성 회절 데이터를 사용하여 훈련된 딥러닝 신경망은 정확한 전자 밀도 맵을 생성할 수 있습니다. 연구는 이 딥러닝 기반의 순순한 구조 솔루션 방법이 단 2옹스트롬의 해상도로 위상 문제를 해결할 수 있음을 보여줍니다. 이는 원자 해상도에서 사용할 수 있는 데이터의 10~20%에 해당하는 반면, 기존의 순순한 계산은

AI의 경우 수학 올림피아드는 더 이상 문제가 되지 않습니다. 목요일에 Google DeepMind의 인공 지능은 AI를 사용하여 올해 국제 수학 올림피아드 IMO의 실제 문제를 해결하는 위업을 달성했으며 금메달 획득에 한 걸음 더 다가섰습니다. 지난 주 막 끝난 IMO 대회에는 대수학, 조합론, 기하학, 수론 등 6개 문제가 출제됐다. 구글이 제안한 하이브리드 AI 시스템은 4문제를 맞혀 28점을 얻어 은메달 수준에 이르렀다. 이달 초 UCLA 종신 교수인 테렌스 타오(Terence Tao)가 상금 100만 달러의 AI 수학 올림피아드(AIMO Progress Award)를 추진했는데, 예상외로 7월 이전에 AI 문제 해결 수준이 이 수준으로 향상됐다. IMO에서 동시에 질문을 해보세요. 가장 정확하게 하기 어려운 것이 IMO인데, 역사도 가장 길고, 규모도 가장 크며, 가장 부정적이기도 합니다.

2023년에는 AI의 거의 모든 분야가 전례 없는 속도로 진화하고 있다. 동시에 AI는 구체화된 지능, 자율주행 등 핵심 트랙의 기술적 한계를 지속적으로 확장하고 있다. 멀티모달 추세 하에서 AI 대형 모델의 주류 아키텍처인 Transformer의 상황이 흔들릴까요? MoE(Mixed of Experts) 아키텍처를 기반으로 한 대형 모델 탐색이 업계에서 새로운 트렌드가 된 이유는 무엇입니까? 대형 비전 모델(LVM)이 일반 비전 분야에서 새로운 돌파구가 될 수 있습니까? ...지난 6개월 동안 공개된 본 사이트의 2023 PRO 회원 뉴스레터에서 위 분야의 기술 동향과 산업 변화에 대한 심층 분석을 제공하여 새로운 환경에서 귀하의 목표 달성에 도움이 되는 10가지 특별 해석을 선택했습니다. 년. 준비하세요. 이 해석은 2023년 50주차에 나온 것입니다.

편집자 |ScienceAI 질문 응답(QA) 데이터 세트는 자연어 처리(NLP) 연구를 촉진하는 데 중요한 역할을 합니다. 고품질 QA 데이터 세트는 모델을 미세 조정하는 데 사용될 수 있을 뿐만 아니라 LLM(대형 언어 모델)의 기능, 특히 과학적 지식을 이해하고 추론하는 능력을 효과적으로 평가하는 데에도 사용할 수 있습니다. 현재 의학, 화학, 생물학 및 기타 분야를 포괄하는 과학적인 QA 데이터 세트가 많이 있지만 이러한 데이터 세트에는 여전히 몇 가지 단점이 있습니다. 첫째, 데이터 형식이 비교적 단순하고 대부분이 객관식 질문이므로 평가하기 쉽지만 모델의 답변 선택 범위가 제한되고 모델의 과학적 질문 답변 능력을 완전히 테스트할 수 없습니다. 이에 비해 개방형 Q&A는

Editor | KX 역합성은 약물 발견 및 유기 합성에서 중요한 작업이며, 프로세스 속도를 높이기 위해 AI가 점점 더 많이 사용되고 있습니다. 기존 AI 방식은 성능이 만족스럽지 못하고 다양성이 제한적입니다. 실제로 화학 반응은 종종 반응물과 생성물 사이에 상당한 중복이 발생하는 국지적인 분자 변화를 일으킵니다. 이에 영감을 받아 Zhejiang University의 Hou Tingjun 팀은 단일 단계 역합성 예측을 분자 문자열 편집 작업으로 재정의하고 표적 분자 문자열을 반복적으로 정제하여 전구체 화합물을 생성할 것을 제안했습니다. 그리고 고품질의 다양한 예측이 가능한 편집 기반 역합성 모델 EditRetro를 제안합니다. 광범위한 실험을 통해 이 모델은 표준 벤치마크 데이터 세트 USPTO-50 K에서 60.8%의 상위 1 정확도로 탁월한 성능을 달성하는 것으로 나타났습니다.

Editor | ScienceAI 제한된 임상 데이터를 기반으로 수백 개의 의료 알고리즘이 승인되었습니다. 과학자들은 누가 도구를 테스트해야 하며 최선의 방법은 무엇인지에 대해 토론하고 있습니다. 데빈 싱(Devin Singh)은 응급실에서 오랜 시간 치료를 기다리던 중 심장마비를 겪는 소아환자를 목격했고, 이를 계기로 대기시간을 단축하기 위해 AI 적용을 모색하게 됐다. SickKids 응급실의 분류 데이터를 사용하여 Singh과 동료들은 잠재적인 진단을 제공하고 테스트를 권장하는 일련의 AI 모델을 구축했습니다. 한 연구에 따르면 이러한 모델은 의사 방문 속도를 22.3% 단축하여 의료 검사가 필요한 환자당 결과 처리 속도를 거의 3시간 단축할 수 있는 것으로 나타났습니다. 그러나 인공지능 알고리즘의 연구 성공은 이를 입증할 뿐이다.
