기술 주변기기 일체 포함 Transformer는 3D 객체 감지를 위해 복셀 기반 표현을 통합합니다.

Transformer는 3D 객체 감지를 위해 복셀 기반 표현을 통합합니다.

Apr 08, 2023 pm 09:41 PM
액자 3d

arXiv 논문 "Unifying Voxel-based Representation with Transformer for 3D ObjectDetection", 6월 22일, 홍콩 중문 대학교, 홍콩 대학교, Megvii Technology(Sun Jian 박사를 기념하여) 및 Simou Technology 등

Transformer는 3D 객체 감지를 위해 복셀 기반 표현을 통합합니다.

본 논문에서는 UVTR이라는 통합 다중 모드 3D 개체 감지 프레임워크를 제안합니다. 이 방법은 복셀 공간의 다중 모드 표현을 통합하고 정확하고 강력한 단일 모드 또는 교차 모드 3D 감지를 가능하게 하는 것을 목표로 합니다. 이를 위해 양식별 공간은 먼저 복셀 특징 공간에 대한 다양한 입력을 나타내도록 설계되었습니다. 높이 압축 없이 복셀 공간을 보존하고 의미적 모호성을 완화하며 공간 상호 작용을 가능하게 합니다. 이러한 통합 접근 방식을 기반으로 지식 전달 및 모드 융합을 포함하여 다양한 센서의 고유한 특성을 완전히 활용하기 위한 교차 모드 상호 작용이 제안됩니다. 이러한 방식으로 포인트 클라우드의 형상 인식 표현과 이미지의 상황에 맞는 특징을 잘 활용하여 성능과 견고성을 높일 수 있습니다.

변환기 디코더는 학습 가능한 위치가 있는 통합 공간에서 특징을 효율적으로 샘플링하는 데 사용되며, 이는 개체 수준 상호 작용을 용이하게 합니다. 일반적으로 UVTR은 통합 프레임워크에서 다양한 양식을 표현하려는 초기 시도를 나타내며 단일 및 다중 모드 입력에 대한 이전 작업을 능가하고 nuScenes 테스트 세트, LiDAR, 카메라 및 다중 모드 출력의 NDS에서 최고의 성능을 달성합니다. 각각 69.7%, 55.1%, 71.1%였다.

코드: https://github.com/dvlab-research/UVTR.

그림과 같이

Transformer는 3D 객체 감지를 위해 복셀 기반 표현을 통합합니다.

표현 통일 과정에서 입력은 다음과 같습니다. 크게 레벨흐름 표현과 특성 레벨흐름 표현으로 구분됩니다. 첫 번째 접근 방식의 경우 다중 모드 데이터가 네트워크 시작 부분에 정렬됩니다. 특히, (a)의 의사 포인트 클라우드는 예측된 깊이 보조 이미지에서 변환되고, (b)의 거리 뷰 이미지는 포인트 클라우드에서 투영됩니다. 의사 점 구름의 깊이 부정확성과 범위 보기 이미지의 3차원 기하학적 붕괴로 인해 데이터의 공간 구조가 파괴되어 결과가 좋지 않습니다. 특징 수준 방법의 경우 일반적인 방법은 그림 (c)와 같이 이미지 특징을 절두체로 변환한 다음 이를 BEV 공간으로 압축하는 것입니다. 그러나 광선과 같은 궤적 때문에 각 위치의 높이 정보(높이) 압축은 다양한 대상의 특징을 집계하여 의미적 모호성을 유발합니다. 동시에, 암시적 접근 방식은 3D 공간에서 명시적인 기능 상호 작용을 지원하기 어렵고 추가 지식 전달을 제한합니다. 따라서 모달 격차를 해소하고 다면적인 상호 작용을 촉진하려면 보다 통일된 표현이 필요합니다.

이 글에서 제안하는 프레임워크는 복셀 기반 표현과 변환기를 통합합니다. 특히, 복셀 기반의 명시적 공간에서 이미지와 포인트 클라우드의 특징 표현 및 상호 작용. 이미지의 경우 그림 (d)에 표시된 대로 예측된 ​​깊이와 기하학적 제약 조건에 따라 이미지 평면에서 특징을 샘플링하여 복셀 공간이 구성됩니다. 포인트 클라우드의 경우 정확한 위치를 통해 자연스럽게 기능을 복셀과 연결할 수 있습니다. 그런 다음 공간적 상호 작용을 위해 복셀 인코더가 도입되어 인접한 특징 간의 관계를 설정합니다. 이러한 방식으로 교차 모달 상호 작용은 각 복셀 공간의 기능과 자연스럽게 진행됩니다. 대상 수준 상호 작용의 경우 그림 (d)에 표시된 대로 변형 가능한 변환기가 디코더로 사용되어 통합 복셀 공간의 각 위치(x, y, z)에서 대상 쿼리 관련 기능을 샘플링합니다. 동시에, 3차원 쿼리 위치의 도입은 BEV 공간에서 높이 정보(높이) 압축으로 인해 발생하는 의미 모호성을 효과적으로 완화합니다.

그림에 표시된 것처럼 다중 모달 입력의 UVTR 아키텍처는 다음과 같습니다. 단일 프레임 또는 다중 프레임 이미지와 포인트 클라우드가 주어지면 먼저 단일 백본에서 처리되고 양식별 공간 VI 및 VP로 변환됩니다. 여기서 뷰 변환은 이미지로 이루어집니다. 복셀 인코더에서는 기능이 공간적으로 상호 작용하며 훈련 중에 지식 전달이 쉽게 지원됩니다. 설정에 따라 모달 스위치를 통해 단일 모드 또는 다중 모드 기능을 선택하십시오. 마지막으로 학습 가능한 위치가 있는 통합 공간 VU에서 특징을 샘플링하고 변환기 디코더를 사용하여 예측합니다.

Transformer는 3D 객체 감지를 위해 복셀 기반 표현을 통합합니다.

그림은 뷰 변환의 세부 사항을 보여줍니다.

Transformer는 3D 객체 감지를 위해 복셀 기반 표현을 통합합니다.

그림은 지식 이전의 세부 사항을 보여줍니다.

Transformer는 3D 객체 감지를 위해 복셀 기반 표현을 통합합니다.

실험 결과는 다음과 같습니다.

Transformer는 3D 객체 감지를 위해 복셀 기반 표현을 통합합니다.

Transformer는 3D 객체 감지를 위해 복셀 기반 표현을 통합합니다.

위 내용은 Transformer는 3D 객체 감지를 위해 복셀 기반 표현을 통합합니다.의 상세 내용입니다. 자세한 내용은 PHP 중국어 웹사이트의 기타 관련 기사를 참조하세요!

본 웹사이트의 성명
본 글의 내용은 네티즌들의 자발적인 기여로 작성되었으며, 저작권은 원저작자에게 있습니다. 본 사이트는 이에 상응하는 법적 책임을 지지 않습니다. 표절이나 침해가 의심되는 콘텐츠를 발견한 경우 admin@php.cn으로 문의하세요.

핫 AI 도구

Undresser.AI Undress

Undresser.AI Undress

사실적인 누드 사진을 만들기 위한 AI 기반 앱

AI Clothes Remover

AI Clothes Remover

사진에서 옷을 제거하는 온라인 AI 도구입니다.

Undress AI Tool

Undress AI Tool

무료로 이미지를 벗다

Clothoff.io

Clothoff.io

AI 옷 제거제

AI Hentai Generator

AI Hentai Generator

AI Hentai를 무료로 생성하십시오.

인기 기사

R.E.P.O. 에너지 결정과 그들이하는 일 (노란색 크리스탈)
3 몇 주 전 By 尊渡假赌尊渡假赌尊渡假赌
R.E.P.O. 최고의 그래픽 설정
3 몇 주 전 By 尊渡假赌尊渡假赌尊渡假赌
R.E.P.O. 아무도들을 수없는 경우 오디오를 수정하는 방법
3 몇 주 전 By 尊渡假赌尊渡假赌尊渡假赌
WWE 2K25 : Myrise에서 모든 것을 잠금 해제하는 방법
3 몇 주 전 By 尊渡假赌尊渡假赌尊渡假赌

뜨거운 도구

메모장++7.3.1

메모장++7.3.1

사용하기 쉬운 무료 코드 편집기

SublimeText3 중국어 버전

SublimeText3 중국어 버전

중국어 버전, 사용하기 매우 쉽습니다.

스튜디오 13.0.1 보내기

스튜디오 13.0.1 보내기

강력한 PHP 통합 개발 환경

드림위버 CS6

드림위버 CS6

시각적 웹 개발 도구

SublimeText3 Mac 버전

SublimeText3 Mac 버전

신 수준의 코드 편집 소프트웨어(SublimeText3)

Java 프레임워크에 대한 상용 지원의 비용 효율성을 평가하는 방법 Java 프레임워크에 대한 상용 지원의 비용 효율성을 평가하는 방법 Jun 05, 2024 pm 05:25 PM

Java 프레임워크에 대한 상용 지원의 비용/성능 평가에는 다음 단계가 포함됩니다. 필요한 보증 수준과 SLA(서비스 수준 계약) 보장을 결정합니다. 연구지원팀의 경험과 전문성. 업그레이드, 문제 해결, 성능 최적화와 같은 추가 서비스를 고려하십시오. 위험 완화 및 효율성 향상을 기준으로 비즈니스 지원 비용을 평가합니다.

PHP 프레임워크의 학습 곡선은 다른 언어 프레임워크와 어떻게 비교됩니까? PHP 프레임워크의 학습 곡선은 다른 언어 프레임워크와 어떻게 비교됩니까? Jun 06, 2024 pm 12:41 PM

PHP 프레임워크의 학습 곡선은 언어 숙련도, 프레임워크 복잡성, 문서 품질 및 커뮤니티 지원에 따라 달라집니다. PHP 프레임워크의 학습 곡선은 Python 프레임워크에 비해 높고 Ruby 프레임워크에 비해 낮습니다. Java 프레임워크에 비해 PHP 프레임워크는 학습 곡선이 적당하지만 시작하는 데 걸리는 시간이 더 짧습니다.

PHP 프레임워크의 경량 옵션은 애플리케이션 성능에 어떤 영향을 줍니까? PHP 프레임워크의 경량 옵션은 애플리케이션 성능에 어떤 영향을 줍니까? Jun 06, 2024 am 10:53 AM

경량 PHP 프레임워크는 작은 크기와 낮은 리소스 소비를 통해 애플리케이션 성능을 향상시킵니다. 그 특징은 다음과 같습니다: 작은 크기, 빠른 시작, 낮은 메모리 사용량, 향상된 응답 속도 및 처리량, 리소스 소비 감소 실제 사례: SlimFramework는 500KB에 불과한 REST API를 생성하며 높은 응답성과 높은 처리량을 제공합니다.

RedMagic Tablet 3D Explorer Edition은 안경이 필요 없는 3D 디스플레이를 제공합니다. RedMagic Tablet 3D Explorer Edition은 안경이 필요 없는 3D 디스플레이를 제공합니다. Sep 06, 2024 am 06:45 AM

RedMagic Tablet 3D Explorer Edition은 Gaming Tablet Pro와 함께 출시되었습니다. 그러나 후자가 게이머를 위한 반면 전자는 엔터테인먼트에 더 적합합니다. 새로운 Android 태블릿에는 회사에서 "육안 3D&qu"라고 부르는 기능이 있습니다.

Golang 프레임워크 문서화 모범 사례 Golang 프레임워크 문서화 모범 사례 Jun 04, 2024 pm 05:00 PM

Golang 프레임워크에서는 명확하고 포괄적인 문서를 작성하는 것이 중요합니다. 모범 사례에는 Google의 Go 코딩 스타일 가이드와 같은 확립된 문서 스타일을 따르는 것이 포함됩니다. 제목, 부제, 목록 등 명확한 조직 구조를 사용하고 탐색 기능을 제공하세요. 시작 안내서, API 참조 및 개념을 포함하여 포괄적이고 정확한 정보를 제공합니다. 코드 예제를 사용하여 개념과 사용법을 설명합니다. 문서를 계속 업데이트하고, 변경 사항을 추적하고, 새로운 기능을 문서화하세요. GitHub 문제 및 포럼과 같은 지원 및 커뮤니티 리소스를 제공합니다. API 문서와 같은 실용적인 예제를 만듭니다.

다양한 애플리케이션 시나리오에 가장 적합한 golang 프레임워크를 선택하는 방법 다양한 애플리케이션 시나리오에 가장 적합한 golang 프레임워크를 선택하는 방법 Jun 05, 2024 pm 04:05 PM

애플리케이션 시나리오를 기반으로 최고의 Go 프레임워크를 선택하세요. 애플리케이션 유형, 언어 기능, 성능 요구 사항 및 생태계를 고려하세요. Common Go 프레임워크: Gin(웹 애플리케이션), Echo(웹 서비스), Fiber(높은 처리량), gorm(ORM), fasthttp(속도). 실제 사례: REST API(Fiber) 구축 및 데이터베이스(gorm)와 상호 작용. 프레임워크를 선택하세요. 주요 성능을 ​​위해서는 fasthttp를 선택하고, 유연한 웹 애플리케이션을 위해서는 Gin/Echo를, 데이터베이스 상호작용을 위해서는 gorm을 선택하세요.

golang 프레임워크 개발에 대한 자세한 실제 설명: 질문과 답변 golang 프레임워크 개발에 대한 자세한 실제 설명: 질문과 답변 Jun 06, 2024 am 10:57 AM

Go 프레임워크 개발에서 일반적인 과제와 해결 방법은 다음과 같습니다. 오류 처리: 관리에는 오류 패키지를 사용하고 중앙에서 오류를 처리하려면 미들웨어를 사용합니다. 인증 및 권한 부여: 타사 라이브러리를 통합하고 사용자 정의 미들웨어를 생성하여 자격 증명을 확인합니다. 동시 처리: 고루틴, 뮤텍스 및 채널을 사용하여 리소스 액세스를 제어합니다. 단위 테스트: 격리를 위해 getest 패키지, 모의 및 스텁을 사용하고, 충분성을 보장하기 위한 코드 적용 도구를 사용합니다. 배포 및 모니터링: Docker 컨테이너를 사용하여 배포를 패키징하고, 데이터 백업을 설정하고, 로깅 및 모니터링 도구를 사용하여 성능과 오류를 추적합니다.

Golang 프레임워크 학습 과정에서 흔히 저지르는 오해는 무엇입니까? Golang 프레임워크 학습 과정에서 흔히 저지르는 오해는 무엇입니까? Jun 05, 2024 pm 09:59 PM

Go 프레임워크 학습에는 다섯 가지 오해가 있습니다. 프레임워크에 대한 과도한 의존과 제한된 유연성입니다. 프레임워크 규칙을 따르지 않으면 코드를 유지 관리하기가 어려워집니다. 오래된 라이브러리를 사용하면 보안 및 호환성 문제가 발생할 수 있습니다. 패키지를 과도하게 사용하면 코드 구조가 난독화됩니다. 오류 처리를 무시하면 예기치 않은 동작과 충돌이 발생합니다.

See all articles