🤖 AI / ML 일간

NVIDIA, 오픈소스 시각 객체 탐지 모델 LocateAnything-3B 공개

NVIDIA가 HuggingFace에 'LocateAnything-3B' 모델을 공개해 큰 주목을 받고 있습니다(좋아요 2,051개, 다운로드 86,968회). 이름 그대로 이미지 안에서 어떤 객체든 찾아내는 시각 기반 object detection 및 grounding 모델로, image-text-to-text 파이프라인으로 동작합니다. Qwen2.5-3B-Instruct를 베이스 모델로 쓰고 NVIDIA의 EAGLE 비전 아키텍처 위에 구축되었습니다. 3B 파라미터라는 비교적 가벼운 크기임에도 높은 성능을 내는 것으로 알려져, 실제 서비스 환경에 배포하기 유리하다는 평가를 받고 있습니다. 여러 arxiv 논문을 기반으로 개발되었으며 오픈소스로 공개되어, 컴퓨터 비전과 멀티모달 연구에 관심 있는 개발자라면 눈여겨볼 만한 모델입니다.

키워드

출처

← 리스트로