비전 기능
이미지 입력을 모델 프롬프트에 첨부해 시각 정보를 이해하거나 생성물에 반영하는 능력으로, 멀티모달 모델이 텍스트와 이미지(또는 비디오)를 동일 맥락에서 처리해야 할 때 요구된다. 글에서는 GLM-5.2가 기본적으로 비전 입력을 지원하지 않으며 이를 보완하는 방법이 제시되었다고 밝혀 시각 기능 확장이 실무적 필요임을 드러낸다. 비전 기능 추가 방식은 모델 아키텍처 수정, 멀티모달 토크나이저 도입, 또는 별도 비전 인코더와의 결합 등으로 구현된다.