TL;DR
로컬에서 검증된 수치 엔진과 버전화된 컨텍스트를 분리하면 LLM이 장비 한계나 구현 유무를 과도하게 일반화하는 위험을 줄일 수 있다. 이 접근은 저채널 EEG처럼 관측 범위가 제한된 센서에 대해 LLM의 수용·거부 결정을 정교하게 조정하는 실용적 메커니즘을 제시한다.
왜 중요한가
로컬에서 검증된 수치 엔진과 버전화된 컨텍스트를 분리하면 LLM이 장비 한계나 구현 유무를 과도하게 일반화하는 위험을 줄일 수 있다. 이 접근은 저채널 EEG처럼 관측 범위가 제한된 센서에 대해 LLM의 수용·거부 결정을 정교하게 조정하는 실용적 메커니즘을 제시한다.
핵심 기여
결정적 로컬 수치 엔진과 언어 레이어 분리 아키텍처 설계
로컬 Python 워크플로가 results.json, report.md, figure 등 기계 판독 가능한 산출물을 생성하고 LLM은 허용목록으로 축약된 요약과 버전된 컨텍스트만 수신하도록 아키텍처를 구성했다. 이 설계는 원시 EEG와 고밀도 배열을 외부 모델로 전송하지 않으며 언어 서비스 실패 시에도 로컬 수치 결과가 보존되게 했다. 또한 각 LLM 호출에 사용된 컨텍스트 버전과 SHA256 해시를 기록해 감사 추적을 가능하게 했다.
Visual Cognitive Load 워크플로의 형식화와 수치화
후방 채널 집합에서 4초 창의 Welch PSD로 평균 posterior alpha(log10 power), 피크 주파수, 우-좌 비대칭을 추출하고 각 특성을 median/MAD로 표준화한 뒤 가중합(q)으로 합성해 기록 내 분위수로 low/medium/high 레이블을 생성했다. 합성 계수는 -z_alpha에 0.65, z_f에 0.15, z_|A|에 0.20를 적용해 상대적 알파 감소가 높은 점수로 이어지게 설계했다. 이 워크플로는 절대 지표가 아니며 품질 제한과 해석 한계를 명시했다.
경계 인식 벤치마크와 컨텍스트 절제 실험
36개 사례를 전극 관찰 가능성, 구현 가능성, 결과 해석, 품질 진단, 과학적 자제, 워크플로 통합 등 6개 범주로 균형 배치하고 Generic, Hardware, Hardware+implementation, Full context의 네 조건에서 두 모델로 총 288 출력을 평가했다. Full context에서 네 가지 경계 정확도가 58.3%에서 79.2%로 상승했고 완전 정답·사실완비·거짓주장 없음 비율이 26.4%에서 66.7%로 증가했다. 컨텍스트 추가가 항상 최적이 아니며 선택적 검색이 더 바람직한 경우가 관찰되었다.
시스템 수준 재현성·프라이버시·장애 격리 실험
12개 기록을 10회 반복 실행해 구조화 페이로드 해시가 반복 간 동일함을 확인했고 엔드투엔드 세 번 반복에서도 결과·리포트·도면 해시가 동일하게 유지됐다. 로컬 요청 캡처에서 원시 샘플과 소스 경로가 누락됨을 확인했고 HTTP 400, 잘못된 출력, 연결 거부 실패 주입 시에도 로컬 결과 파일이 보존됐다. 합성 아티팩트 주입 실험으로 현재 품질 임계치의 검출 한계와 플랫라인 미검출 같은 구체적 약점을 확인했다.
핵심 아이디어 이해하기
문제 출발점은 ‘모든 LLM이 장비와 소프트웨어의 구체적 제약을 자동으로 아는 것은 아니다’라는 사실이다. LLM은 광범위한 EEG 지식을 내포할 수 있으나 특정 센서 배열, 구현된 워크플로, 결과 필드의 의미, 그리고 과학적 한계는 별도 정보가 없으면 판단할 수 없다. 저채널 EEG는 공간 표본화가 희박해 관측 가능한 신호와 해석 가능한 결론을 혼동하기 쉬우며, 이로 인해 모델이 물리적으로 불가능하거나 구현되지 않은 분석을 ‘그럴듯하게’ 생성할 위험이 커진다.
이 논문이 취한 해결 원리는 계산 경계와 언어 경계를 분리하는 것이다. 구체적으로, 로컬에서 결정적 수치 엔진이 모든 신호 전처리·품질 제어·스펙트럼 워크플로를 실행해 기계 판독 가능한 산출물을 생성한다. 언어 레이어는 이 결과의 축약된 허용 목록 페이로드와 버전된 컨텍스트 팩만을 수신해 해석과 계획을 수행하므로 LLM이 원시 데이터를 사용해 임의로 필터나 임계치를 변경할 수 없다.
이 접근은 세 가지 변화를 가져온다. 첫째, 수치적 정합성은 로컬 엔진이 보장하므로 언어 모델의 불확실한 생성이 수치 결과를 변경하지 못한다. 둘째, 하드웨어·구현·결과·과학 경계 정보를 명시적으로 제공하면 LLM의 수용·조건부 수용·거부 결정이 더 정확해진다. 셋째, 컨텍스트를 무차별로 늘리는 대신 관련 문서만 선택적으로 검색해 주입하면 과도한 거부나 오도된 채택을 줄일 수 있다.
관련 Figure

하드웨어 정보만으로도 즉각적인 정확도 개선이 관찰되며 구현·결과 필드 정보를 추가하면 required-fact recall과 엄격 안전 응답률이 추가로 증가한다. 그러나 Full context가 모든 부지표에서 최상은 아니었고 일부 지표에서 Hardware+implementation이 소폭 더 나은 결과를 보였으므로 맥락 문서의 양을 무조건 늘리는 대신 관련성에 기반한 선택적 검색이 바람직하다. 이 패턴은 retrieval-augmented 구조에서 맥락 선택 정책의 중요성을 뒷받침한다.
컨텍스트 절제 실험의 합성 경계 점수와 구성 요소별 기여도를 선과 막대 차트로 정리한 그림이다.
방법론
전체 접근은 로컬 결정적 계산과 버전된 컨텍스트 기반의 언어 해석으로 구성된다. 입력된 7채널 EEG는 엄격한 I/O층으로 들어가 로컬 엔진이 검토된 Python 워크플로를 실행해 results.json, report.md, figure 파일과 정제 데이터 일부를 생성한다. 그 다음 허용목록 규칙에 따라 워크플로별로 필요한 필드만 골라 compact interpretation summary를 만들고 raw_eeg_included=false를 명시해 외부 호출로 원시 샘플과 고밀도 배열을 제외한다.
핵심 메커니즘은 컨텍스트 팩의 구조와 감사성이다. 컨텍스트 팩은 하드웨어 프로필, 검토된 워크플로 설명, 결과 필드 가이드, 구현 매핑, 과학적 한계, 참조 사례, 시스템 정책을 포함하며 각 호출에 사용된 파일 목록과 SHA256 해시를 기록한다. 벤치마크는 네 가지 컨텍스트 조합(Generic, Hardware, Hardware+implementation, Full)과 두 모델 별로 동일한 사례를 생성해 결정 정확도, 필수 사실 회수율, 과도한 거부율, 허용되지 않은 수용율 등을 측정한다.
실험적 검증은 세 영역에서 수행됐다. 첫째, 재현성 검증으로 동일 환경에서 다중 반복 실행 시 결과 해시 일관성을 확인했다. 둘째, 프라이버시·요청 경계 검증으로 로컬 캡처 엔드포인트에서 interpretation 요청이 원시 샘플과 소스 경로를 포함하지 않는지 점검했다. 셋째, 아티팩트 주입과 라우팅·장애 주입 실험으로 품질 임계치 반응과 LLM 실패 시 로컬 아티팩트 보존 능력을 평가했다.
관련 Figure

왼쪽 그래프는 raw TXT 원본이 외부 요청들보다 여러 자릿수 크게 전달되어 원시 데이터가 외부로 전송되지 않도록 한 설계의 필요성을 강조한다. 오른쪽 그래프는 사전 정의된 프라이버시 검사 항목들이 현재 구현에서 모두 통과했음을 보고하고, 이는 허용목록 페이로드 규칙이 의도한 노출 감소를 달성했음을 지지한다. 이 그림은 애플리케이션 쪽 노출 감소와 감사 가능성의 실측 증거로 연결된다.
로컬 원시 입력과 외부 API 요청 바이트(로그 스케일) 비교 및 프라이버시 경계 확인 결과를 수평 바 차트로 나타낸 그림이다.
주요 결과
결과의 주요 수치적 발견은 경계 인식 정확도와 안전 응답 비율의 유의한 개선이다. 네 가지 컨텍스트 조건의 결합 결과, pooled exact decision accuracy는 Generic 58.3%에서 Full context 79.2%로 상승했고 required-fact recall은 48.7%에서 80.8%로 증가했다. 또한 완전 정답·사실완비·거짓주장 없음의 엄격한 안전 응답 비율은 26.4%에서 66.7%로 개선됐다.
시스템 수준 결과로는 12개 기록을 10회 반복한 결정적 재현성 테스트에서 구조화 페이로드 해시가 동일하게 유지되었고 엔드투엔드 3회 반복에서도 결과·리포트·도면 해시가 일치했다. 요청 캡처에서는 원시 EEG 값과 소스 경로가 요청에 포함되지 않았고 interpretation 요청 바이트 수는 원시 파일 대비 훨씬 작았다. 장애 주입(HTTP 400, malformed output, connection refused) 실험에서 로컬 결과 파일과 로그는 보존되었다.
아티팩트 주입 실험에서는 50Hz·30Hz 정현성 간섭이 5 μV에서는 검출되지 않았고 10 μV 이상에서 모든 반복이 검출되어 해당 구간이 완전 차단되었다. 플랫라인(dropout) 주입은 현재 워크플로의 한계로 인해 검출되지 않았고 이는 품질 워크플로에 명시적 flatline 검출기가 필요함을 시사했다.
관련 Figure

상단 패널은 동일한 기록을 여러 번 처리했을 때 페이로드가 일관되게 100% 정확(해시 일치)을 보였음을 나타낸다. 하단 박스플롯은 워크플로별 실행 시간이 비교적 짧고 일부 작업에서 런타임 분포가 넓게 나타났음을 보여준다. 요청 바이트와 로컬 아티팩트 보존 관련 서브패널은 interpretation 요청이 원시 녹음보다 훨씬 작고 언어 서비스 실패에도 로컬 결과가 보존된다는 점을 실증한다.
결정적 반복성과 런타임 분포, 요청 바이트 비교 및 라우팅/장애 격리 결과를 요약한 다중 패널 차트이다.

라우팅 실험 결과 로컬 키워드 기반 라우팅이 91.7%의 정확도를 보였고 LLM 플래너는 고정 프롬프트 세트에서 모든 의도를 선택했다는 점이 확인됐다. 장애 주입 패널은 HTTP 400, 잘못된 출력, 연결 거부 상황에서도 results.json과 report.md 등 로컬 아티팩트가 보존되었다는 점을 보여준다. 이 데이터는 계산과 언어 서비스의 분리 설계가 실패 상황에서도 수치적 진실을 유지함을 지지한다.
다국어 라우팅 정확도와 LLM 실패 주입 시 로컬 산출물 보존을 요약한 바 차트와 분포 플롯이다.

그래프는 5 μV 수준에서는 정현성 간섭이 검출되지 않다가 10 μV 이상에서 모든 반복이 검출되어 검출 임계치가 실험적으로 확인되었음을 나타낸다. 고진폭 임펄스는 필터링으로 인해 주변 샘플로 퍼져 여러 임계치 횡단을 일으켜 한 번의 삽입이 광범위 검출을 초래할 수 있음을 시사한다. 플랫라인 주입은 현 워크플로에서 검출되지 않았고 이는 품질 워크플로에 명시적 flatline 검출기가 부재함을 지적한다.
50Hz·30Hz 간섭, 이상치 스파이크, 플랫라인 드롭아웃 등 합성 아티팩트 주입에 대한 검출·세그먼트 거부·위양성율을 표시한 4패널 그래프이다.

풀 컨텍스트 조건에서 pooled exact decision accuracy가 Generic 대비 현저히 상승해 하드웨어·구현 정보의 유의한 기여가 실증됐다. 카테고리별 히트맵은 전극 관찰성·구현 능력·과학적 자제 등 특정 영역에서 풀 컨텍스트가 특히 안전 응답률을 높였음을 보여준다. 다만 워크플로 통합 카테고리는 상대적으로 낮아 문서화만으로는 파이프라인 인터페이스를 완전히 보완할 수 없음을 시사한다.
경계 인식 벤치마크의 구성, 모델별 성능 바 플롯, required-fact recall과 strict safe-response 등 핵심 지표를 집계한 다중 패널 시각화이다.
기술 상세
전체 아키텍처는 엄격한 I/O층, 로컬 결정적 과학 코어, 허용목록 기반 페이로드 생성, 버전된 컨텍스트 팩, 그리고 선택적 LLM 해석기로 구성된다. I/O와 하드웨어 프로필은 7채널(순서 CP5,CP6,PO3,PO4,O1,Oz,O2)과 250Hz 샘플링을 전제로 하며 품질 임계치는 49–51Hz 선형 잡음, 20–40Hz 고주파 전력, 절대 진폭 100 μV, 1초 세그먼트당 임계치 횡단 샘플 2개 초과, 채널 분리 비율 0.4 초과, 이웃 상관 최소 0.15 등으로 구성된다.
Visual Cognitive Load 워크플로는 4초 창, 1초 스텝으로 나누어 Welch PSD를 계산해 각 창에 대해 posterior alpha(log10 power), alpha 피크 주파수, 우-좌 정규화 비대칭 A를 산출한다. 각 특성 zα, zf, z|A|을 median/MAD로 표준화하고 −zα에 0.65, zf에 0.15, z|A|에 0.20을 곱해 클리핑한 합성 점수 q를 계산한 뒤 기록 내 분위수로 레이블을 생성한다. 이 파이프라인은 클리핑 범위와 가중치, 유효 창 기준(창의 80% 이상 샘플 유효) 등 구현 세부를 포함해 버전 관리된다.
벤치마크 설계는 36개 사례를 네 컨텍스트 조건과 두 모델로 교차해 총 288 출력을 수집하고 exact four-way decision, constraint-source F1, required-fact recall, unsupported acceptance, feasible rejection, strict safe-response 등 복수의 지표로 평가했다. 통계적 비교에는 Wilson 구간과 McNemar 검정을 사용했다.
한계점
벤치마크의 골드 레이블과 질문지는 NeuraDock 코드와 문서에서 파생되었으며 외부 독립 검증자가 작성한 것이 아니다. 실험은 두 개의 provider 모델 별칭과 세팅된 하나의 시드로 실행됐고, 각 사례당 한 번의 생성만 수집되어 모델 샘플링 변이를 충분히 반영하지 않는다. 재현성 검증은 단일 실행 환경에서 수행되어 운영체제·Python 버전·수치 라이브러리 차이를 포함한 교차 플랫폼 재현성은 확보되지 않았다. 품질 실험은 합성 교란을 사용했기 때문에 자연 기록에서의 민감도·특이도 추정치로 일반화할 수 없다.
실무 활용
코드와 컨텍스트 팩이 공개되어 있어 연구·엔지니어링·프로토타이핑 용도로 바로 활용 가능한 개발자 도구로 사용 가능하다. 로컬 결정적 엔진과 허용목록 페이로드 패턴은 민감 데이터 노출을 줄이면서 LLM 기반 인터페이스를 안전하게 통합하는 실무적 설계 사례로 적용 가능하다.
- 저채널 EEG 장비와 결합한 연구용 데이터 파이프라인에서 자동 해석 초안 생성 및 보고서 초안 작성
- 품질 게이트가 필요한 실험용 대시보드에서 LLM을 인터페이스 계층으로 사용해 사용자 안내와 조치 권고 생성
- 교육용 도구로서 학생에게 검토된 워크플로와 관찰 가능한 신호의 차이를 시연하는 데 활용
- 제품 프로토타입의 안전 테스트 단계에서 LLM의 수용·거부 정책을 검증하는 자동화된 벤치마크 응용
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Boundary awareness
- — LLM이 특정 센서·소프트웨어·결과의 적용 가능 범위를 구분하는 능력으로, 물리적 관찰 가능성, 구현 여부, 결과 해석 한계, 과학적 추론 가능성을 각각 분리하여 판단하는 체계이다. 이 논문에서는 하드웨어·워크플로·결과 스키마·과학적 한계를 명시한 버전된 컨텍스트로 LLM의 출력을 경계 내로 제한하는 방식으로 적용되었다.
- Versioned context
- — 하드웨어 프로필, 검토된 워크플로, 결과 필드 정의, 구현 매핑, 시스템 정책과 참조 사례를 명시하고 SHA256 해시로 추적 가능한 단일 컨텍스트 팩으로 관리하는 방식이다. 이 팩은 각 LLM 호출에 포함된 문서의 버전을 기록해 언어 레이어가 참조한 정보의 정확한 출처를 검증 가능하게 만든다.
- Allowlisted interpretation payload
- — 로컬 수치 엔진이 생성한 전체 결과에서 워크플로별로 엄선한 필드만을 포함하는 축약 JSON 페이로드로, raw_eeg_included=false를 명시해 원시 샘플과 고밀도 배열을 외부 모델 호출로 노출하지 않는다. 허용항목에는 품질 요약, 핵심 지표, 보존/제거 수치 및 해석 한계가 포함된다.
- Visual Cognitive Load
- — 후방 채널 기반의 상대적 within-recording 지표로, 4초 창 Welch PSD에서 산출한 후방 알파(log10 power), 피크 주파수, 좌우 비대칭을 표준화해 합성 점수(q)를 만들고 세 분위수로 저·중·고 레이블을 할당하는 연구용 추정치이다. 절대 지표나 임상적 진단으로 사용될 수 없고 같은 기록 내 상대 비교에 한정된다.
- Deterministic workflow
- — 동일한 소프트웨어와 환경에서 여러 반복 실행 시 동일한 results.json, report.md, figure 해시를 생성하도록 고정된 파이썬 기반 수치 처리 파이프라인이다. NeuraDock에서는 로컬 엔진이 검토된 파이썬 코드를 실행해 수치적 진실을 유지하고 언어 레이어가 이를 해석하도록 분리했다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.