이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.
TL;DR
건설 BIM의 IDS 규격은 XML 문법과 IFC 어휘를 동시에 만족시켜야 하므로 일반 목적 LLM으로는 정확한 출력이 어렵다. ONESTRUCTION은 Qwen3 기반에 합성 데이터 중심의 Continued Pre-Training, 지도 미세조정, 그리고 IDS-Audit-Tool을 보상으로 쓰는 RLVR의 세 단계 파이프라인을 적용해 구조적·의미적 정확도를 끌어올렸다. Amazon EC2 P5en, AWS ParallelCluster, Amazon FSx for Lustre 기반 분산 훈련으로 대규모 실험을 안정화했고 IDS-Bench에서 XML·IDS 구조 준수는 거의 100%에 근접하고 내용 일관성은 80% 이상을 기록했다. 합성 데이터 품질, 검증 가능한 보상, 안정적 인프라가 데이터가 희소한 전문 분야에서 도메인 특화 모델을 만드는 데 핵심이었다.
섹션별 상세
문제 정의와 맥락은 데이터가 희소한 건설·BIM 분야에서 IDS(Information Delivery Specifications) 작성의 진입 장벽이 높다는 점이다. IDS는 XML 기반의 문법적 제약과 IFC 어휘 매핑을 요구하므로 일반 목적의 LLM만으로는 정확한 구조화 출력을 얻기 어렵다. 이 문제를 해결하기 위해 합성 데이터 생성, 도메인 전문가 협업, 그리고 검증 가능한 보상을 결합한 파이프라인이 필요했다.
학습 파이프라인은 세 단계로 구성되어 있다: Continued Pre-Training(CPT), Supervised Fine-Tuning(SFT), Reinforcement Learning with Verifiable Rewards(RLVR). CPT 단계에서는 웹 코퍼스와 도메인 전문가가 만든 합성 IDS 파일을 대량 투입해 모델이 IDS·IFC 어휘와 패턴을 먼저 흡수하도록 했다. 이후 SFT로 입력(명령문 혹은 CSV)과 기대 출력(IDS 파일) 페어를 학습시키고, 마지막 RLVR 단계에서는 IDS-Audit-Tool의 검사 결과를 보상으로 삼아 구조적·의미적 일관성을 추가로 개선했다.
근거
- RLVR 단계에서는 buildingSMART의 IDS-Audit-Tool을 보상 함수로 사용해 구조적·의미적 정확도를 개선했다. — 기술 접근 방식 설명에서 RLVR에 IDS-Audit-Tool을 명시적으로 사용했다고 기술
데이터 전략은 합성 데이터 중심의 설계와 도메인 전문가 개입이 핵심이다. 합성 데이터로 다양한 IDS 사례를 대량 생성하면서도 도메인 전문가는 품질 검증과 예외 케이스 설계에 관여해 데이터 정확도를 확보했다. 이 조합은 단순 볼륨 확장이 아닌 고품질 합성 데이터가 모델 성능 향상에 결정적임을 가능하게 했다.
인프라 설계는 대규모 분산 훈련의 안정성 확보에 초점을 맞췄다. Amazon EC2 P5en 인스턴스(p5en.48xlarge, NVIDIA H200)를 두 노드로 구성하고 AWS ParallelCluster로 오케스트레이션했으며, Amazon FSx for Lustre를 통해 훈련 데이터와 체크포인트에 대한 병렬 접근성을 확보했다. 이 구성은 멀티노드 훈련에서 I/O 병목과 안정성 이슈를 줄여 연구 반복 속도를 높였다.

평가와 결과는 IDS-Bench라는 내부 벤치마크로 측정되었고, 구조적 합법성 측면에서 높은 성과를 보였다. Ishigaki-IDS는 XML 구조 준수와 IDS 구조 준수 점수가 거의 100%에 근접했고 IDS 내용 일관성은 80%를 초과했다는 수치가 보고되었다. 일반 목적의 프론티어 모델들은 구조는 일부 만족하나 IDS 구조 준수와 내용 일관성에서 크게 뒤처져 도메인 특화 모델의 필요성이 입증되었다.

근거
- Ishigaki-IDS는 XML 구조 준수와 IDS 구조 준수에서 거의 100%에 근접하는 점수를 기록했다. — IDS-Bench 결과 요약 및 Figure 2의 막대그래프에서 Ishigaki-IDS 계열이 상위권에 위치함
- IDS 내용 일관성(semantic/content consistency)은 Ishigaki-IDS에서 80%를 초과하는 수준이었다. — 본문 결과 섹션의 수치 설명과 Figure 2 그래프의 어두운 파란색 막대 비교
용어 해설
- 정보 전달 규격(IDS)(IDS)
- — IDS는 BIM(Building Information Modeling) 모델에 붙는 정보를 구조적으로 정의하는 XML 기반 표준이다. 특정 태그 패턴과 반복 구조로 작성되어 문서의 구조적·의미적 일관성을 검사할 수 있으며, 도메인별 규칙을 포함해 기계적 검증이 가능하다. 학습 관점에서는 단순 텍스트가 아닌 문법적 제약을 가진 구조화된 출력을 요구한다.
- Industry Foundation Classes (IFC)(IFC)
- — IFC는 건물의 요소와 속성을 표준화한 데이터 스키마로서 건축·설비·구조 정보를 표현한다. 각 요소는 IfcBeam, IfcUnitaryEquipment 등 고유한 엔티티명으로 매핑되며 IDS는 이러한 IFC 용어와 속성에 연결되어 검증을 수행한다. 모델이 IFC 어휘를 이해하려면 수천 개의 매핑을 정확히 학습해야 한다.
- 검증 가능한 보상을 사용하는 강화학습(RLVR)(RLVR)
- — RLVR은 생성 출력에 대해 자동화된 검증 도구를 보상 함수로 사용해 모델을 강화학습하는 방법이다. 출력의 문법·구조·의미적 일관성을 IDS-Audit-Tool 같은 체크로 점수화하고 그 점수를 보상으로 삼아 정책을 갱신한다. 감독 데이터가 부족한 영역에서 기계적 만족도를 빠르게 향상시키는 수단이다.
- YaRN (Yet another RoPE extensioN)(YaRN)
- — YaRN은 Transformer의 RoPE(Positional Encoding)를 확장해 문맥 길이를 늘리는 기술이다. 기존 학습 길이를 넘어선 입력에서도 성능 저하를 최소화하며, 본 사례에서는 약 120k 토큰 수준의 입출력을 안정적으로 처리할 수 있도록 컨텍스트 확장을 지원했다. 긴 문서 기반 작업에서 구조화된 출력 유지에 기여한다.
- Amazon FSx for Lustre
- — Amazon FSx for Lustre는 고성능 컴퓨팅에 최적화된 관리형 파일시스템으로서 낮은 지연과 높은 처리량을 제공한다. 훈련 데이터, 합성 데이터, 체크포인트를 다수 노드에서 병렬로 읽고 쓸 수 있어 대규모 분산 훈련의 I/O 병목을 완화한다. 본 프로젝트에서는 안정적 멀티노드 학습 환경을 위해 스토리지 계층으로 활용되었다.
기술
- Qwen3는 Alibaba Cloud에서 공개한 LLM 패밀리로서 8B, 14B, 32B 같은 다양한 파라미터 규모를 제공해 소규모 실험에서 대형 모델까지 단계적으로 확장할 수 있도록 했다. 본 사례에서는 Qwen3을 기반 모델로 삼아 CPT·SFT·RLVR 파이프라인을 적용해 도메인 특화 성능을 확보했다.
- Amazon EC2 P5en(p5en.48xlarge) 인스턴스는 NVIDIA H200 Tensor Core GPU를 탑재해 대규모 분산 훈련에 필요한 연산 성능을 제공했다. 두 노드 구성으로 멀티노드 훈련을 수행하면서 모델 병렬화와 데이터 병렬화 전략을 적용했다.
- AWS ParallelCluster는 AWS 상에서 HPC 클러스터를 배포·관리하는 오픈소스 도구로서 노드 프로비저닝과 작업 스케줄링을 단순화했다. 이 도구를 통해 훈련 환경의 반복 재현성과 안정성을 높여 연구자가 모델 개선에 집중할 수 있게 했다.
- Amazon FSx for Lustre는 고처리량·저지연의 관리형 파일시스템으로서 훈련 데이터와 체크포인트에 대한 병렬 접근을 지원했다. 멀티노드 훈련에서 I/O 병목을 완화하고 데이터 로딩 안정성을 제공해 전체 실험 신뢰도를 높였다.
- IDS-Audit-Tool은 buildingSMART가 제공하는 IDS 검증 도구로 XML 문법, IDS 구조 유효성, 의미 일관성 등을 자동으로 검사한다. 이 도구의 판정 결과를 RLVR 보상으로 연결함으로써 모델이 구조적·의미적 오류를 줄이도록 학습했다.
- YaRN은 RoPE 기반의 positional encoding을 확장해 Transformer 모델의 컨텍스트 길이를 늘리는 기법으로서 약 120k 토큰 수준의 입력·출력을 처리할 수 있도록 컨텍스트 확장성을 제공했다. 긴 문서나 복잡한 구조화 출력에서 모델 일관성 유지에 기여했다.
활용 사례
- 비전문가가 IDS 파일을 자동 생성하거나 검토하는 워크플로우를 지원할 수 있다. 사용자는 자연어 지시나 CSV 형태의 입력을 주면 모델이 규칙에 맞는 IDS 출력을 생성하며, IDS-Audit-Tool로 자동 검증한 결과를 바탕으로 수정 반복을 줄일 수 있다. 이는 현장 실무자의 학습 부담을 줄이고 정보 전달의 표준화를 촉진한다.
- 데이터가 희소한 산업 분야에서 도메인 특화 파운데이션 모델을 만들 때 합성 데이터와 검증 가능한 보상을 결합한 접근법을 적용할 수 있다. 합성 데이터로 기초 지식을 채우고 RLVR로 구조적 정확도를 다듬는 방식은 레이블이 제한적인 상황에서 실용적 성능을 낼 수 있다. 다른 규격 기반 문서 생성 작업으로 확장 가능하다.
- 대규모 분산 훈련 인프라를 활용해 긴 컨텍스트를 필요로 하는 모델을 실무에 적용할 수 있다. YaRN 같은 컨텍스트 확장 기법과 P5en 기반 분산 훈련 조합은 대량의 문서 처리와 구조화된 출력 생성을 함께 달성하게 한다. 건설뿐 아니라 도면·제품 문서 등 긴 입력을 다루는 분야에 응용될 수 있다.
언급된 리소스
문서AWS Generative AI Innovation Center (GenAIIC)
문서AWS ParallelCluster User Guide
GitHubIshigaki-IDS 모델 (Hugging Face)
문서IDS-Audit-Tool (buildingSMART)
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 08. 12.수집 2026. 08. 12.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.