본문으로 건너뛰기

터키어 Python 지시 데이터셋 22만 8918쌍 공개

터키어 Python 학습용 중복 제거 데이터 228,918쌍과 토큰별 JSONL 파일이 공개됐다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

bysismo가 터키어 Python 학습을 위한 Turkish-Python-instruction-300k 데이터셋을 공개했다. 범주별 행은 335,286개이고, 엄격한 중복 제거를 거친 고유 지시문 쌍은 228,918개이며 전체 패키지는 207.18 MB다. 사용자는 96~386 토큰 이하로 나뉜 JSONL 파일에서 one-liner, 함수, 알고리즘, OOP, metaprogramming, enterprise architecture 관련 데이터를 골라 Hugging Face의 datasets 라이브러리로 불러올 수 있다. 학술·연구·비상업적 개인 사용은 허용되지만 상업적 이용에는 작성자의 명시적 동의가 필요하다.

실용적 조언

  • 짧은 Python 코드나 Copilot형 샘플이 필요하면 Skiller_Toplam_96_Token.jsonl을 선택하고, 함수와 기본 논리까지 포함하려면 Skiller_Toplam_128_Token.jsonl을 선택할 수 있다. 더 긴 알고리즘과 클래스 구조가 필요할 때는 186, 256, 286, 386 토큰 구간 파일로 범위를 넓히면 된다. 각 파일명에 토큰 상한과 주제 범위가 드러나므로 전체 207.18 MB 패키지를 먼저 받기보다 용도에 맞는 파일을 지정하는 방식이 가능하다.
  • Python 환경에서는 datasets의 load_dataset에 bysismo/Turkish-Python-instruction-300k와 원하는 JSONL 파일명을 전달하면 된다. 전체 패키지는 Turkish-Python-instruction.jsonl을 사용하고, 256 토큰 구간은 Skiller_Toplam_256_Token.jsonl을 사용하도록 원문 코드가 구성돼 있다. 상업적 시스템에 통합하기 전에는 작성자의 별도 동의가 필요하다는 이용 조건을 확인해야 한다.

섹션별 상세

01
게시물은 Turkish-Python-instruction-300k를 터키어 Python 학습용 데이터셋으로 공개하면서 범주별 335,286개 행과 중복 제거된 고유 지시문 쌍 228,918개를 제시했다. 데이터는 23개 범주를 목표로 하는 커리큘럼 중 8개 주요 engineering 범주가 완료된 상태이며, 전체 목표 규모는 1.15M으로 적혀 있다. 따라서 단일 파일만 제공하는 방식보다 학습 범주와 샘플 길이에 따라 데이터를 선택할 수 있는 구조가 핵심이다.
02
파일 구성은 전체 패키지와 토큰 길이별 JSONL 파일로 나뉘며, 전체 파일은 228,918행과 207.18 MB다. 96 토큰 이하 파일은 114,888행과 69.05 MB이고, 256 토큰 이하 파일은 228,463행과 206.31 MB이며, 386 토큰 이하 파일은 228,916행과 207.17 MB다. 사용자는 짧은 one-liner부터 함수, algorithm, OOP, descriptor, metaprogramming, enterprise architecture까지 입력 길이와 주제에 맞춰 파일을 고를 수 있다.
03
실제 사용은 datasets의 load_dataset 함수에 데이터셋 식별자와 data_files 값을 전달하는 방식이다. 전체 학습 자료를 읽으려면 Turkish-Python-instruction.jsonl을 지정하고, 256 토큰 구간만 읽으려면 Skiller_Toplam_256_Token.jsonl을 지정하도록 코드가 제공됐다. 상업적 이용에는 작성자 Hakan Tektakar 또는 bysismo의 명시적 동의가 필요하며, 학술·연구·비상업적 오픈소스 개인 사용은 무료 접근 범위로 적혀 있다.

용어 해설

토큰 기준 분할(Golden Token Standard)
데이터를 각 샘플의 토큰 길이 범위에 따라 96, 128, 186, 256, 286, 386 토큰 이하 묶음으로 나눈 기준이다. 작업 성격과 입력 길이에 맞는 파일을 고르는 데 쓰인다.
지시문 쌍(Instruction Pair)
사용자의 지시와 그에 대응하는 Python 코드 또는 답변으로 구성된 학습 데이터 단위다. 이 데이터셋은 중복을 제거한 고유 지시문 쌍을 228,918개 포함한다고 밝혔다.
중복 제거(Deduplication)
같거나 반복되는 학습 샘플을 식별해 하나만 남기는 데이터 정제 과정이다. 게시물은 범주별 335,286개 행에서 중복을 엄격히 제거한 고유 지시문 쌍을 따로 집계했다.
객체지향 프로그래밍(Object-Oriented Programming)
클래스와 객체를 중심으로 코드를 구성하는 Python 프로그래밍 방식이다. 데이터셋은 클래스와 OOP, 고급 OOP, descriptor, metaprogramming 관련 토큰 구간을 별도 파일로 제공한다.
메타프로그래밍(Metaprogramming)
프로그램이 코드나 객체의 구조와 동작을 다루도록 만드는 고급 프로그래밍 기법이다. 이 데이터셋에서는 고급 OOP, descriptor와 함께 286 토큰 이하 구간에 포함됐다.

코드 예제

python
from datasets import load_dataset

# 1. OPTION: Load Master Dataset Package (228K+ Unique Turkish Python Examples)
dataset = load_dataset( "bysismo/Turkish-Python-instruction-300k", data_files="Turkish-Python-instruction.jsonl" )

# 2. OPTION: Load by Golden Token Bucket (e.g. 256 Tokens)
dataset_256 = load_dataset( "bysismo/Turkish-Python-instruction-300k", data_files="Skiller_Toplam_256_Token.jsonl" )

Hugging Face의 datasets 라이브러리로 전체 JSONL 패키지나 256 토큰 구간 파일을 불러오는 예시다.

언급된 도구

datasets중립

Hugging Face 데이터셋 저장소의 JSONL 파일을 load_dataset 함수로 불러오는 Python 라이브러리다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 17.수집 2026. 08. 17.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.