이론적 기반을 바탕으로 심층적인 최적화를 수행할 수 있습니다.-일체 포함-php.cn

집

기술 주변기기

일체 포함

이론적 기반을 바탕으로 심층적인 최적화를 수행할 수 있습니다.

WBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWB

Sep 20, 2023 pm 03:05 PM

이론 transformer

트랜스포머의 성능이 왜 이렇게 좋은가요? 많은 대규모 언어 모델에 제공되는 상황 내 학습 기능은 어디에서 왔습니까? 인공지능 분야에서는 트랜스포머가 딥러닝의 지배적인 모델로 자리 잡았지만, 그 뛰어난 성능에 대한 이론적 근거는 충분히 연구되지 않았습니다.

최근 Google AI, ETH Zurich 및 Google DeepMind 연구원들의 새로운 연구에서는 미스터리에 대한 답을 밝히려고 시도했습니다. 새로운 연구에서 그들은 변압기를 역설계하고 몇 가지 최적화 방법을 찾았습니다. 논문 "Transformers에서 메사 최적화 알고리즘 발견": 이론적 기반을 바탕으로 심층적인 최적화를 수행할 수 있습니다.

논문 링크: https://arxiv.org/abs/2309.05858

저자는 일반적인 자기회귀 손실을 최소화하는 것이 Transformer의 순방향 전달에서 발생함을 증명했습니다. 에서 실행되는 보조 그래디언트 기반 최적화 알고리즘입니다. 이 현상은 최근 "메사 최적화"라고 불립니다. 또한 연구진은 결과적인 메사 최적화 알고리즘이 모델 크기와 관계없이 상황에 맞는 소규모 학습 기능을 나타냄을 발견했습니다. 따라서 새로운 결과는 이전에 대규모 언어 모델에서 나타난 소규모 학습의 원칙을 보완합니다.

연구원들은 Transformers의 성공이 순방향 패스에서 메사 최적화 알고리즘을 구현하는 아키텍처적 편견, 즉 (i) 내부 학습 목표 정의 및 (ii) 최적화에 기반을 두고 있다고 믿습니다. ㅋㅋㅋ . 입력 시퀀스로 s_1, . . , s_t는 시간 단계 t로 처리되고, Transformer는 (i) 입력-대상 연관 쌍으로 구성된 내부 훈련 세트를 생성하고, (ii) 결과 데이터 세트를 통해 내부 목적 함수를 정의하며, 이는 내부 모델의 성능을 측정하는 데 사용됩니다. 가중치 W 사용, (iii) 이 목표를 최적화하고 학습된 모델을 사용하여 미래 예측을 생성합니다

이론적 기반을 바탕으로 심층적인 최적화를 수행할 수 있습니다.

. ^{이 연구의 기여는 다음과 같습니다.}

von Oswald 등의 이론을 일반화하고 Transformer가 회귀 예측의 그라데이션 기반 방법을 사용하여 내부적으로 구성된 목표를 이론적으로 최적화할 수 있는 방법을 보여줍니다. 시퀀스의 다음 요소입니다.

실험적으로 역설계된 Transformer는 간단한 시퀀스 모델링 작업에 대해 교육을 받았으며 순방향 전달이 2단계 알고리즘을 구현한다는 강력한 증거를 발견했습니다. (i) 그룹화 및 복사 마커를 통한 초기 self-attention 레이어는 내부 교육 데이터 세트를 구축하므로 내부 훈련 데이터 세트를 암시적으로 구축합니다. 내부 목적 함수를 정의하고 (ii) 더 깊은 수준에서 이러한 목표를 최적화하여 예측을 생성합니다.

LLM과 유사하게 실험에 따르면 간단한 자동 회귀 훈련 모델도 상황 학습자가 될 수 있으며 즉각적인 조정은 LLM의 상황 학습을 개선하는 데 중요하며 특정 환경에서도 성능을 향상할 수 있습니다.
Attention 레이어가 내부 목적 함수를 암시적으로 최적화하려고 한다는 발견에서 영감을 받아 저자는 단일 그래디언트 단계를 수행하는 대신 최소 제곱 최적화 문제를 효과적으로 해결할 수 있는 새로운 유형의 Attention 레이어인 메사 레이어를 소개합니다. 최적성을 달성하기 위해. 실험에 따르면 단일 메사 레이어는 간단한 순차 작업에서 심층 선형 및 소프트맥스 셀프 어텐션 트랜스포머보다 성능이 뛰어나면서도 더 많은 해석 가능성을 제공하는 것으로 나타났습니다.

이론적 기반을 바탕으로 심층적인 최적화를 수행할 수 있습니다.

상황에 맞게 소규모 작업을 해결하도록 명시적으로 훈련된 변환기가 경사하강법(GD) 알고리즘을 구현할 수 있음을 보여주는 최근 연구를 기반으로 합니다. 여기에서 저자는 이러한 결과가 LLM 교육에 대한 일반적인 접근 방식인 자동 회귀 시퀀스 모델링으로 일반화됨을 보여줍니다.

먼저 각 시퀀스가 서로 다른 W*에 의해 생성되는 단순 선형 역학에 대해 훈련된 변환기를 분석하여 교차 시퀀스 기억을 방지합니다. 이 간단한 설정에서 저자는 메사 데이터 세트를 생성한 다음 사전 처리된 GD를 사용하여 메사 대상을 최적화하는 변환기를 시연합니다.

이 연구는 인접한 시퀀스 요소를 집계하는 토큰 구조에서 심층 변환기를 훈련합니다. 흥미롭게도 이 간단한 전처리로 인해 매우 희박한 가중치 행렬이 생성되어(가중치의 1% 미만이 0이 아님) 역설계된 알고리즘이 생성됩니다.

이론적 기반을 바탕으로 심층적인 최적화를 수행할 수 있습니다.

단층 선형 셀프 어텐션의 경우 가중치는 하나의 GD 단계에 해당합니다. 심층 변압기의 경우 해석이 어려워집니다. 이 연구는 선형 조사에 의존하고 숨겨진 활성화가 자기회귀 목표 또는 전처리된 입력을 예측하는지 여부를 조사합니다.

흥미롭게도 두 가지 탐지 방법의 예측 가능성은 네트워크 깊이가 증가함에 따라 점차 향상됩니다. 이 발견은 전처리된 GD가 모델에 숨겨져 있음을 시사합니다. 그림 2: 훈련된 선형 self-attention 레이어의 역엔지니어링.

이론적 기반을 바탕으로 심층적인 최적화를 수행할 수 있습니다.

^{연구에 따르면 학습된 학습률 θ뿐만 아니라 학습된 초기 가중치 W_0 세트를 포함하여 모든 자유도를 구성에 사용할 때 훈련 레이어가 완벽하게 맞춰질 수 있다는 사실이 밝혀졌습니다. 중요한 것은 그림 2에서 볼 수 있듯이 학습된 1단계 알고리즘이 여전히 단일 메사 레이어보다 훨씬 더 나은 성능을 발휘한다는 것입니다.}

간단한 가중치 설정 하에서 이 레이어가 여기서 연구한 작업을 최적으로 해결할 수 있다는 것을 기본 최적화를 통해 쉽게 찾을 수 있음을 알 수 있습니다. 이 결과는 메사 최적화에 유리한 하드 코딩된 유도 바이어스의 이점을 보여줍니다.

다층 사례에 대한 이론적 통찰을 바탕으로 먼저 Transformer에만 주목하여 심층 선형 및 소프트맥스를 분석합니다. 저자는 W_0 = 0 선택에 해당하는 4채널 구조

에 따라 입력 형식을 지정합니다.

단일 레이어 모델과 마찬가지로 저자는 훈련된 모델의 가중치에서 명확한 구조를 확인합니다. 첫 번째 리버스 엔지니어링 분석으로 이 연구는 이 구조를 활용하고 레이어 헤더당(3200 대신) 16개의 매개변수를 포함하는 알고리즘(RevAlg-d, 여기서 d는 레이어 수를 나타냄)을 구축합니다. 저자는 이 압축되었지만 복잡한 표현이 훈련된 모델을 설명할 수 있다는 것을 발견했습니다. 특히 실제 Transformer와 RevAlg-d 가중치 사이를 거의 무손실 방식으로 보간할 수 있습니다.

RevAlg-d 표현식은 소수의 자유 매개변수를 사용하여 훈련된 다층 변환기를 설명하지만 이를 메사 최적화 알고리즘으로 해석하기는 어렵습니다. 따라서 저자는 가설화된 메사 최적화 알고리즘의 특성을 찾기 위해 선형 회귀 프로빙 분석(Alain & Bengio, 2017; Akyürek et al., 2023)을 사용했습니다.

그림 3에 표시된 Deep Linear Self-Attention Transformer에서 두 프로브 모두 선형적으로 디코딩할 수 있으며 시퀀스 길이와 네트워크 깊이가 증가함에 따라 디코딩 성능이 향상되는 것을 볼 수 있습니다. 따라서 기본 최적화는 메사 최적화 문제의 조건수를 개선하면서 원래의 메사 목적 Lt(W)에서 계층별로 하강하는 하이브리드 알고리즘을 발견합니다. 이로 인해 메사 대물렌즈 Lt(W)가 급격히 감소합니다. 또한 깊이가 증가함에 따라 성능이 크게 향상되는 것을 볼 수 있습니다.

따라서 자동 회귀 메사 목표 Lt(W)의 급격한 감소는 더 나은 전처리된 데이터에 대한 단계적(교차 계층) 메사 최적화에 의해 달성된다고 간주할 수 있습니다. 그림 3: 리버스 엔지니어링 내장 입력을 위한 다층 변환기 교육.

이는 변환기가 내장된 토큰에 대해 교육을 받으면 메사 최적화를 통해 예측한다는 것을 보여줍니다. 흥미롭게도 시퀀스 요소가 직접 주어지면 변환기는 요소를 그룹화하여 자체적으로 토큰을 구성하는데, 연구팀은 이를 "메사 데이터 세트 생성"이라고 부릅니다.

결론

이론적 기반을 바탕으로 심층적인 최적화를 수행할 수 있습니다.

이 연구는 Transformer 모델이 표준 자동 회귀 목표 하에 시퀀스 예측 작업을 훈련할 때 경사 기반 추론 알고리즘을 개발할 수 있음을 보여줍니다. 따라서 다중 작업, 메타 학습 설정에서 얻은 최첨단 결과를 기존의 자가 감독 LLM 교육 설정으로 전송할 수도 있습니다.

또한 연구에 따르면 학습된 자동 회귀 추론 알고리즘의 용도를 변경하여 재교육 없이 지도 상황별 학습 작업을 해결하고 단일 통합 프레임워크 내에서 결과를 설명할 수 있다는 사실이 밝혀졌습니다.

이론적 기반을 바탕으로 심층적인 최적화를 수행할 수 있습니다.

그렇다면 이것이 상황 내 학습과 어떤 관련이 있나요? 이 연구에서는 자동 회귀 시퀀스 작업에 대한 변환기를 훈련한 후 적절한 메사 최적화를 달성하고 따라서 미세 조정 없이 몇 번의 상황 학습을 수행할 수 있다고 믿습니다.

이론적 기반을 바탕으로 심층적인 최적화를 수행할 수 있습니다.

본 연구에서는 LLM에도 메사 최적화가 존재한다고 가정하여 상황별 학습 능력을 향상시킵니다. 흥미롭게도 이 연구에서는 LLM에 대한 프롬프트를 효과적으로 적용하면 상황별 학습 능력이 크게 향상될 수 있다는 점도 관찰했습니다.

이론적 기반을 바탕으로 심층적인 최적화를 수행할 수 있습니다.

관심 있는 독자는 논문의 원문을 읽고 연구 내용에 대해 자세히 알아볼 수 있습니다.

^{참조 콘텐츠:}

^{https://www.reddit.com/r/MachineLearning/comments/16jc2su/r_uncovering_mesaoptimization_algorithms_in/}

^{https://twitter.com/ 오스왈드조/status/1701873029100241241}

위 내용은 이론적 기반을 바탕으로 심층적인 최적화를 수행할 수 있습니다.의 상세 내용입니다. 자세한 내용은 PHP 중국어 웹사이트의 기타 관련 기사를 참조하세요!

본 웹사이트의 성명

본 글의 내용은 네티즌들의 자발적인 기여로 작성되었으며, 저작권은 원저작자에게 있습니다. 본 사이트는 이에 상응하는 법적 책임을 지지 않습니다. 표절이나 침해가 의심되는 콘텐츠를 발견한 경우 admin@php.cn으로 문의하세요.

핫 AI 도구

Undresser.AI Undress

사실적인 누드 사진을 만들기 위한 AI 기반 앱

AI Clothes Remover

사진에서 옷을 제거하는 온라인 AI 도구입니다.

Undress AI Tool

무료로 이미지를 벗다

Clothoff.io

AI 옷 제거제

Video Face Swap

완전히 무료인 AI 얼굴 교환 도구를 사용하여 모든 비디오의 얼굴을 쉽게 바꾸세요!

뜨거운 도구

메모장++7.3.1

사용하기 쉬운 무료 코드 편집기

SublimeText3 중국어 버전

중국어 버전, 사용하기 매우 쉽습니다.

스튜디오 13.0.1 보내기

강력한 PHP 통합 개발 환경

드림위버 CS6

시각적 웹 개발 도구

SublimeText3 Mac 버전

신 수준의 코드 편집 소프트웨어(SublimeText3)

뜨거운 주제

Gmail 이메일의 로그인 입구는 어디에 있나요?

7758

자바 튜토리얼

1644

Cakephp 튜토리얼

1399

라라벨 튜토리얼

1293

PHP 튜토리얼

1234

Related knowledge

'Defect Spectrum'은 기존 결함 감지의 경계를 뛰어넘어 초고정밀 및 풍부한 의미론적 산업 결함 감지를 최초로 달성합니다. Jul 26, 2024 pm 05:38 PM

현대 제조업에서 정확한 결함 검출은 제품 품질을 보장하는 열쇠일 뿐만 아니라 생산 효율성을 향상시키는 핵심이기도 합니다. 그러나 기존 결함 감지 데이터세트는 실제 적용에 필요한 정확성과 의미론적 풍부함이 부족한 경우가 많아 모델이 특정 결함 카테고리나 위치를 식별할 수 없게 됩니다. 이 문제를 해결하기 위해 광저우 과학기술대학교와 Simou Technology로 구성된 최고 연구팀은 산업 결함에 대한 상세하고 의미론적으로 풍부한 대규모 주석을 제공하는 "DefectSpectrum" 데이터 세트를 혁신적으로 개발했습니다. 표 1에서 볼 수 있듯이, 다른 산업 데이터 세트와 비교하여 "DefectSpectrum" 데이터 세트는 가장 많은 결함 주석(5438개의 결함 샘플)과 가장 상세한 결함 분류(125개의 결함 카테고리)를 제공합니다.

NVIDIA 대화 모델 ChatQA는 버전 2.0으로 발전했으며 컨텍스트 길이는 128K로 언급되었습니다. Jul 26, 2024 am 08:40 AM

오픈 LLM 커뮤니티는 백개의 꽃이 피어 경쟁하는 시대입니다. Llama-3-70B-Instruct, QWen2-72B-Instruct, Nemotron-4-340B-Instruct, Mixtral-8x22BInstruct-v0.1 등을 보실 수 있습니다. 훌륭한 연기자. 그러나 GPT-4-Turbo로 대표되는 독점 대형 모델과 비교하면 개방형 모델은 여전히 많은 분야에서 상당한 격차를 보이고 있습니다. 일반 모델 외에도 프로그래밍 및 수학을 위한 DeepSeek-Coder-V2, 시각 언어 작업을 위한 InternVL과 같이 핵심 영역을 전문으로 하는 일부 개방형 모델이 개발되었습니다.

수백만 개의 결정 데이터로 훈련하여 결정학적 위상 문제를 해결하는 딥러닝 방법인 PhAI가 Science에 게재되었습니다. Aug 08, 2024 pm 09:22 PM

Editor |KX 오늘날까지 단순한 금속부터 큰 막 단백질에 이르기까지 결정학을 통해 결정되는 구조적 세부 사항과 정밀도는 다른 어떤 방법과도 비교할 수 없습니다. 그러나 가장 큰 과제인 소위 위상 문제는 실험적으로 결정된 진폭에서 위상 정보를 검색하는 것입니다. 덴마크 코펜하겐 대학의 연구원들은 결정 위상 문제를 해결하기 위해 PhAI라는 딥러닝 방법을 개발했습니다. 수백만 개의 인공 결정 구조와 그에 상응하는 합성 회절 데이터를 사용하여 훈련된 딥러닝 신경망은 정확한 전자 밀도 맵을 생성할 수 있습니다. 연구는 이 딥러닝 기반의 순순한 구조 솔루션 방법이 단 2옹스트롬의 해상도로 위상 문제를 해결할 수 있음을 보여줍니다. 이는 원자 해상도에서 사용할 수 있는 데이터의 10~20%에 해당하는 반면, 기존의 순순한 계산은

Google AI가 IMO 수학 올림피아드 은메달을 획득하고 수학적 추론 모델 AlphaProof가 출시되었으며 강화 학습이 다시 시작되었습니다. Jul 26, 2024 pm 02:40 PM

AI의 경우 수학 올림피아드는 더 이상 문제가 되지 않습니다. 목요일에 Google DeepMind의 인공 지능은 AI를 사용하여 올해 국제 수학 올림피아드 IMO의 실제 문제를 해결하는 위업을 달성했으며 금메달 획득에 한 걸음 더 다가섰습니다. 지난 주 막 끝난 IMO 대회에는 대수학, 조합론, 기하학, 수론 등 6개 문제가 출제됐다. 구글이 제안한 하이브리드 AI 시스템은 4문제를 맞혀 28점을 얻어 은메달 수준에 이르렀다. 이달 초 UCLA 종신 교수인 테렌스 타오(Terence Tao)가 상금 100만 달러의 AI 수학 올림피아드(AIMO Progress Award)를 추진했는데, 예상외로 7월 이전에 AI 문제 해결 수준이 이 수준으로 향상됐다. IMO에서 동시에 질문을 해보세요. 가장 정확하게 하기 어려운 것이 IMO인데, 역사도 가장 길고, 규모도 가장 크며, 가장 부정적이기도 합니다.

PRO | MoE 기반의 대형 모델이 더 주목받는 이유는 무엇인가요? Aug 07, 2024 pm 07:08 PM

2023년에는 AI의 거의 모든 분야가 전례 없는 속도로 진화하고 있다. 동시에 AI는 구체화된 지능, 자율주행 등 핵심 트랙의 기술적 한계를 지속적으로 확장하고 있다. 멀티모달 추세 하에서 AI 대형 모델의 주류 아키텍처인 Transformer의 상황이 흔들릴까요? MoE(Mixed of Experts) 아키텍처를 기반으로 한 대형 모델 탐색이 업계에서 새로운 트렌드가 된 이유는 무엇입니까? 대형 비전 모델(LVM)이 일반 비전 분야에서 새로운 돌파구가 될 수 있습니까? ...지난 6개월 동안 공개된 본 사이트의 2023 PRO 회원 뉴스레터에서 위 분야의 기술 동향과 산업 변화에 대한 심층 분석을 제공하여 새로운 환경에서 귀하의 목표 달성에 도움이 되는 10가지 특별 해석을 선택했습니다. 년. 준비하세요. 이 해석은 2023년 50주차에 나온 것입니다.

대형 모델에 대한 새로운 과학적이고 복잡한 질문 답변 벤치마크 및 평가 시스템을 제공하기 위해 UNSW, Argonne, University of Chicago 및 기타 기관이 공동으로 SciQAG 프레임워크를 출시했습니다. Jul 25, 2024 am 06:42 AM

편집자 |ScienceAI 질문 응답(QA) 데이터 세트는 자연어 처리(NLP) 연구를 촉진하는 데 중요한 역할을 합니다. 고품질 QA 데이터 세트는 모델을 미세 조정하는 데 사용될 수 있을 뿐만 아니라 LLM(대형 언어 모델)의 기능, 특히 과학적 지식을 이해하고 추론하는 능력을 효과적으로 평가하는 데에도 사용할 수 있습니다. 현재 의학, 화학, 생물학 및 기타 분야를 포괄하는 과학적인 QA 데이터 세트가 많이 있지만 이러한 데이터 세트에는 여전히 몇 가지 단점이 있습니다. 첫째, 데이터 형식이 비교적 단순하고 대부분이 객관식 질문이므로 평가하기 쉽지만 모델의 답변 선택 범위가 제한되고 모델의 과학적 질문 답변 능력을 완전히 테스트할 수 없습니다. 이에 비해 개방형 Q&A는

자연의 관점: 의학 분야의 인공지능 테스트는 혼란에 빠졌습니다. 어떻게 해야 할까요? Aug 22, 2024 pm 04:37 PM

Editor | ScienceAI 제한된 임상 데이터를 기반으로 수백 개의 의료 알고리즘이 승인되었습니다. 과학자들은 누가 도구를 테스트해야 하며 최선의 방법은 무엇인지에 대해 토론하고 있습니다. 데빈 싱(Devin Singh)은 응급실에서 오랜 시간 치료를 기다리던 중 심장마비를 겪는 소아환자를 목격했고, 이를 계기로 대기시간을 단축하기 위해 AI 적용을 모색하게 됐다. SickKids 응급실의 분류 데이터를 사용하여 Singh과 동료들은 잠재적인 진단을 제공하고 테스트를 권장하는 일련의 AI 모델을 구축했습니다. 한 연구에 따르면 이러한 모델은 의사 방문 속도를 22.3% 단축하여 의료 검사가 필요한 환자당 결과 처리 속도를 거의 3시간 단축할 수 있는 것으로 나타났습니다. 그러나 인공지능 알고리즘의 연구 성공은 이를 입증할 뿐이다.

정확도는 60.8%에 달합니다. Transformer를 기반으로 한 Zhejiang University의 화학적 역합성 예측 모델은 Nature 저널에 게재되었습니다. Aug 06, 2024 pm 07:34 PM

Editor | KX 역합성은 약물 발견 및 유기 합성에서 중요한 작업이며, 프로세스 속도를 높이기 위해 AI가 점점 더 많이 사용되고 있습니다. 기존 AI 방식은 성능이 만족스럽지 못하고 다양성이 제한적입니다. 실제로 화학 반응은 종종 반응물과 생성물 사이에 상당한 중복이 발생하는 국지적인 분자 변화를 일으킵니다. 이에 영감을 받아 Zhejiang University의 Hou Tingjun 팀은 단일 단계 역합성 예측을 분자 문자열 편집 작업으로 재정의하고 표적 분자 문자열을 반복적으로 정제하여 전구체 화합물을 생성할 것을 제안했습니다. 그리고 고품질의 다양한 예측이 가능한 편집 기반 역합성 모델 EditRetro를 제안합니다. 광범위한 실험을 통해 이 모델은 표준 벤치마크 데이터 세트 USPTO-50 K에서 60.8%의 상위 1 정확도로 탁월한 성능을 달성하는 것으로 나타났습니다.

See all articles

이론적 기반을 바탕으로 심층적인 최적화를 수행할 수 있습니다.

핫 AI 도구

Undresser.AI Undress

AI Clothes Remover

Undress AI Tool

Clothoff.io

Video Face Swap

인기 기사

뜨거운 도구

메모장++7.3.1

SublimeText3 중국어 버전

스튜디오 13.0.1 보내기

드림위버 CS6

SublimeText3 Mac 버전

뜨거운 주제