in-context-multimodal-conditioning
맥락 내 멀티모달 조건화
이미지와 텍스트 같은 여러 입력 양식을 하나의 맥락으로 결합해 생성 모델의 출력을 조절하는 방식입니다. 이 연구는 카메라 정보를 전용 camera token으로 삽입하고 객체의 기준 좌표계를 설명하는 텍스트를 추가해 목표 방향과 객체 의미를 함께 전달합니다.
맥락 내 멀티모달 조건화
이미지와 텍스트 같은 여러 입력 양식을 하나의 맥락으로 결합해 생성 모델의 출력을 조절하는 방식입니다. 이 연구는 카메라 정보를 전용 camera token으로 삽입하고 객체의 기준 좌표계를 설명하는 텍스트를 추가해 목표 방향과 객체 의미를 함께 전달합니다.