본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

Tiger3807861189/J-Space-Cognition-Suite-V3.6

Python0 / 0

추론 시점 작업 공간과 검증·복구 흐름을 주입하는 model-agnostic Skill

TL;DR

J-Space Cognition Suite V3.6은 모델 가중치나 학습 과정을 건드리지 않고 `SKILL.md`를 단일 진입점으로 삼아 추론 시점의 작업 공간, 선택적 모듈 로딩, 검증, 복구, 장기 상태 기록을 조정하는 Python 기반 Skill이다. 짧은 작업은 `fast`, 제한된 다단계 작업은 `full`, 여러 파일과 도구 및 지속 상태가 필요한 작업은 `loop`로 처리하며 선택형 `jspace.py`가 `.jspace/` 아래에 ledger와 checkpoint를 저장한다. DeepSeek V4-Flash-0731 조건에서 HLE 도구 사용 점수는 51.5에서 60.6으로, NL2Repo는 54.2에서 70.2로, DeepSWE는 54.4에서 67.4로 올라간 프로젝트 기록이 있으나 평가 환경과 비교 모델 조건이 서로 다르다. 네이티브 Skill 로더가 있고 긴 에이전트 작업의 상태 유지와 검증 흐름이 문제라면 도입할 가치가 있지만, 일반적인 Python 라이브러리처럼 import해 기능을 호출하는 패키지는 아니다.

핵심 포인트

  • 이 저장소는 특정 모델의 가중치를 바꾸지 않고 추론 시점에 작업 공간과 상태 관리 규칙을 주입하는 model-agnostic Skill이다. Anthropic의 J-space 관련 해석 가능성 연구에서 사용된 작업 공간 용어를 바탕으로 하며 Claude Code, Codex, DeepSeek Harness 등 Skill을 지원하는 호스트에 연결할 수 있다. 모델 학습이나 Fine-tuning 없이 기존 에이전트의 장기 작업 처리 흐름을 조정하려는 경우에 맞는다.
  • 단일 진입점인 `SKILL.md`가 작업을 `fast`, `full`, `loop` 패스로 나누고 필요한 모듈과 참고 자료만 선택적으로 불러온다. 여러 파일과 도구가 얽힌 작업에서는 ledger, seam, checkpoint, register audit, recovery를 사용해 상태와 검증 범위를 `.jspace/`에 기록한다. 선택적 로딩으로 모든 규칙을 매 요청에 넣지 않으면서 긴 작업의 일관성과 복구 가능성을 유지하는 구조이다.
  • 배포는 저장소의 `j-space/` 디렉터리를 호스트의 사용자 수준 Skills 디렉터리에 통째로 복사하는 방식이며 `modules/`, `references/`, `scripts/`의 상대 경로를 보존해야 한다. Python 3 표준 라이브러리로 동작하는 선택형 `jspace.py` 컨트롤러는 목표, 다음 행동, 핵심 상태, 검증 기록을 저장하지만 해결책 선택은 모델에 남긴다. 네이티브 Skill 로더가 없는 환경에서는 `SKILL.md`를 system 또는 developer instruction으로 제공하고 관련 파일을 검색 도구로 노출하는 방식으로 통합한다.
  • README의 비교표는 DeepSeek Harness 최소 설정을 참고한 프로젝트 평가 기록이며, 하드웨어와 도구 접근성, 프로세스 격리, 정보 접근 경계에 따라 결과가 달라질 수 있다고 명시한다. DeepSeek V4-Flash-0731에 J-Space V3.6을 붙인 조건은 HLE 도구 미사용에서 37.8점 대비 45.5점, NL2Repo에서 54.2점 대비 70.2점, DeepSWE에서 54.4점 대비 67.4점으로 기록됐다. 다만 비교 모델의 수치는 각 제공자가 공개한 별도 평가 조건을 유지하므로 동일한 실험으로 직접 우열을 확정하기보다 특정 모델과 Harness에서의 프로젝트 기록으로 읽어야 한다.

벤치마크

벤치마크지표비교
HLE 도구 미사용native score45.5DeepSeek V4-Flash-0731 단독 37.8 대비 J-Space V3.6 적용 조건
HLE 도구 사용native score60.6DeepSeek V4-Flash-0731 단독 51.5 대비 J-Space V3.6 적용 조건
Terminal Bench 2.1native score87.1DeepSeek V4-Flash-0731 단독 82.7 대비 J-Space V3.6 적용 조건
NL2Reponative score70.2DeepSeek V4-Flash-0731 단독 54.2 대비 J-Space V3.6 적용 조건
CyberGymnative score81.7DeepSeek V4-Flash-0731 단독 76.7 대비 J-Space V3.6 적용 조건
DeepSWEnative score67.4DeepSeek V4-Flash-0731 단독 54.4 대비 J-Space V3.6 적용 조건
Toolathlon-Verifiednative score77.7DeepSeek V4-Flash-0731 단독 70.3 대비 J-Space V3.6 적용 조건
Agents' Last Examnative score30.1DeepSeek V4-Flash-0731 단독 25.2 대비 J-Space V3.6 적용 조건
AutomationBench Publicnative score31.7DeepSeek V4-Flash-0731 단독 25.1 대비 J-Space V3.6 적용 조건
Speedscore/time1.09대조 조건 0.43 대비 2.53×로 기록됐으며 동일한 task와 model 조건의 한 번의 평가 실행
Token costtokens/score1.19대조 조건 2.63 대비 2.21× 개선으로 기록됐으며 낮을수록 좋은 지표

3k

Stars

205

Forks

+218

Trending

0

조회수

3k watchers38 open issuesApache License 2.0

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.