멀티모달 AI
[multi modal]멀티모달 AI(Multimodal AI)는 텍스트·이미지·음성·영상 등 서로 다른 데이터 양식(modality)을 동시에 이해하고 처리하는 인공지능 기술이다. 기존 AI가 하나의 데이터 유형만 처리하는 단일모달(single-modal) 방식이었다면, 멀티모달 AI는 여러 형태의 정보를 결합해 보다 종합적인 판단과 생성 작업을 수행할 수 있다.
예를 들어 이미지로 텍스트를 검색하거나, 텍스트 설명만으로 이미지를 생성하고, 이미지와 문장을 함께 이해해 질문에 답하는 작업 등이 가능하다. 최근에는 대규모멀티모달모델(LMM)의 발전으로 음성·영상·문서·센서 데이터까지 통합 처리하는 방향으로 진화하고 있다.
멀티모달 AI는 인간의 자연스러운 의사소통 방식을 모방한 기술로 평가된다. 사람은 사물을 인식할 때 글·소리·표정·맥락을 동시에 이해하는데, 멀티모달 AI 역시 다양한 정보를 결합해 의미를 추론한다. 이를 통해 검색, 자율주행, 의료영상 분석, AI 비서, 로보틱스 등에서 더 높은 정확도와 직관적인 사용자 경험을 제공할 수 있다.
관련어
- 참조어대규모 멀티모달모델, 제로샷 러닝, 파운데이션 모델
-
모바일 주민등록증
스마트폰 저장형 주민등록증. 기존 실물 주민등록증과 동일한 법적 효력을 가지며, 관공서, ...
-
미재무성시리즈 I 채권[Inflation-adjusted Series I savings bonds, U.S. Treasury Series I Bonds, I채권]
미재무성시리즈 I 채권(U.S. Treasury Series I Bondss·I채권) 또는...
-
무라바하[Murabaha]
이슬람 은행이 주택이나 자동차, 기계 등을 사려는 사람과 계약을 맺고 이 사람을 대신해 대...
-
물적분할 자회사 상장관련 일반주주 권익 제고 방안
금융위원회와 금융감독원이 물적분할에 반대하는 주주를 보호하기 위해 도입하기로 한 정책으로 ...