microsoft/bitnet-b1.58-2B-4T
텍스트 생성 및 언어 이해2Bmit
가중치를 -1, 0, 1의 삼진법으로 표현하여 추론 효율을 극대화한 2B 규모의 1비트 언어 모델이다.
학습 방식 · BitNet b1.58 아키텍처 기반의 1.58비트 양자화 학습, 4조 개의 토큰을 사용한 대규모 사전 학습
핵심 포인트
- 기존 FP16 모델 대비 추론 시 에너지 소비 대폭 절감
- 행렬 곱셈을 덧셈 연산으로 대체하여 계산 복잡도 감소
- 2B 파라미터 규모에서 4T 토큰 학습을 통한 높은 지식 밀도
- 텍스트 생성
1.4k
LIKES
13.3k
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.