Tiger3807861189/J-Space-Cognition-Suite-V3.6
Python0 / 0
추론 시점 작업 공간과 검증·복구 흐름을 주입하는 model-agnostic Skill
TL;DR
J-Space Cognition Suite V3.6은 모델 가중치나 학습 과정을 건드리지 않고 `SKILL.md`를 단일 진입점으로 삼아 추론 시점의 작업 공간, 선택적 모듈 로딩, 검증, 복구, 장기 상태 기록을 조정하는 Python 기반 Skill이다. 짧은 작업은 `fast`, 제한된 다단계 작업은 `full`, 여러 파일과 도구 및 지속 상태가 필요한 작업은 `loop`로 처리하며 선택형 `jspace.py`가 `.jspace/` 아래에 ledger와 checkpoint를 저장한다. DeepSeek V4-Flash-0731 조건에서 HLE 도구 사용 점수는 51.5에서 60.6으로, NL2Repo는 54.2에서 70.2로, DeepSWE는 54.4에서 67.4로 올라간 프로젝트 기록이 있으나 평가 환경과 비교 모델 조건이 서로 다르다. 네이티브 Skill 로더가 있고 긴 에이전트 작업의 상태 유지와 검증 흐름이 문제라면 도입할 가치가 있지만, 일반적인 Python 라이브러리처럼 import해 기능을 호출하는 패키지는 아니다.
핵심 포인트
- 이 저장소는 특정 모델의 가중치를 바꾸지 않고 추론 시점에 작업 공간과 상태 관리 규칙을 주입하는 model-agnostic Skill이다. Anthropic의 J-space 관련 해석 가능성 연구에서 사용된 작업 공간 용어를 바탕으로 하며 Claude Code, Codex, DeepSeek Harness 등 Skill을 지원하는 호스트에 연결할 수 있다. 모델 학습이나 Fine-tuning 없이 기존 에이전트의 장기 작업 처리 흐름을 조정하려는 경우에 맞는다.
- 단일 진입점인 `SKILL.md`가 작업을 `fast`, `full`, `loop` 패스로 나누고 필요한 모듈과 참고 자료만 선택적으로 불러온다. 여러 파일과 도구가 얽힌 작업에서는 ledger, seam, checkpoint, register audit, recovery를 사용해 상태와 검증 범위를 `.jspace/`에 기록한다. 선택적 로딩으로 모든 규칙을 매 요청에 넣지 않으면서 긴 작업의 일관성과 복구 가능성을 유지하는 구조이다.
- 배포는 저장소의 `j-space/` 디렉터리를 호스트의 사용자 수준 Skills 디렉터리에 통째로 복사하는 방식이며 `modules/`, `references/`, `scripts/`의 상대 경로를 보존해야 한다. Python 3 표준 라이브러리로 동작하는 선택형 `jspace.py` 컨트롤러는 목표, 다음 행동, 핵심 상태, 검증 기록을 저장하지만 해결책 선택은 모델에 남긴다. 네이티브 Skill 로더가 없는 환경에서는 `SKILL.md`를 system 또는 developer instruction으로 제공하고 관련 파일을 검색 도구로 노출하는 방식으로 통합한다.
- README의 비교표는 DeepSeek Harness 최소 설정을 참고한 프로젝트 평가 기록이며, 하드웨어와 도구 접근성, 프로세스 격리, 정보 접근 경계에 따라 결과가 달라질 수 있다고 명시한다. DeepSeek V4-Flash-0731에 J-Space V3.6을 붙인 조건은 HLE 도구 미사용에서 37.8점 대비 45.5점, NL2Repo에서 54.2점 대비 70.2점, DeepSWE에서 54.4점 대비 67.4점으로 기록됐다. 다만 비교 모델의 수치는 각 제공자가 공개한 별도 평가 조건을 유지하므로 동일한 실험으로 직접 우열을 확정하기보다 특정 모델과 Harness에서의 프로젝트 기록으로 읽어야 한다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| HLE 도구 미사용 | native score | 45.5 | DeepSeek V4-Flash-0731 단독 37.8 대비 J-Space V3.6 적용 조건 |
| HLE 도구 사용 | native score | 60.6 | DeepSeek V4-Flash-0731 단독 51.5 대비 J-Space V3.6 적용 조건 |
| Terminal Bench 2.1 | native score | 87.1 | DeepSeek V4-Flash-0731 단독 82.7 대비 J-Space V3.6 적용 조건 |
| NL2Repo | native score | 70.2 | DeepSeek V4-Flash-0731 단독 54.2 대비 J-Space V3.6 적용 조건 |
| CyberGym | native score | 81.7 | DeepSeek V4-Flash-0731 단독 76.7 대비 J-Space V3.6 적용 조건 |
| DeepSWE | native score | 67.4 | DeepSeek V4-Flash-0731 단독 54.4 대비 J-Space V3.6 적용 조건 |
| Toolathlon-Verified | native score | 77.7 | DeepSeek V4-Flash-0731 단독 70.3 대비 J-Space V3.6 적용 조건 |
| Agents' Last Exam | native score | 30.1 | DeepSeek V4-Flash-0731 단독 25.2 대비 J-Space V3.6 적용 조건 |
| AutomationBench Public | native score | 31.7 | DeepSeek V4-Flash-0731 단독 25.1 대비 J-Space V3.6 적용 조건 |
| Speed | score/time | 1.09 | 대조 조건 0.43 대비 2.53×로 기록됐으며 동일한 task와 model 조건의 한 번의 평가 실행 |
| Token cost | tokens/score | 1.19 | 대조 조건 2.63 대비 2.21× 개선으로 기록됐으며 낮을수록 좋은 지표 |
3k
Stars
205
Forks
+218
Trending
0
조회수
3k watchers38 open issuesApache License 2.0
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.