TL;DR
OpenAI는 내부 버전인 Astra를 사용해 10개의 오랜 수학 난제에 대해 해법을 시도했고, 결과물로 Lean 4 정형화 파일과 논문 및 LLM이 재구성한 증명 과정을 공개했다. 회사는 각 문제당 GPT-5.6 Sol 토큰 가격 기준으로 2,000달러 미만을 썼다고 주장하지만 전체 실패 사례 수 등은 밝히지 않았다. Simon Willison은 Anthropic의 Claude 실험 사례와 함께 이를 언급하며, Terence Tao가 말한 'big mathematics'가 가리키는 인간‑기계 분업 가능성을 환기한다.
섹션별 상세
- OpenAI는 내부 버전의 Astra를 사용해 10개의 수학 문제를 해결하고 각 문제에 대해 GPT-5.6 Sol 토큰 가격 기준으로 문제당 2,000달러 미만을 사용했다고 주장한다. — 원문 본문과 OpenAI 관련 링크에서 Astra 언급 및 'less than $2,000 at GPT-5.6 Sol token prices'라는 문구 확인 가능. 추가 증빙은 논문과 GitHub 저장소에 포함된 정형화 자료. 출처
- 결과물로 openai/ten-proofs GitHub 저장소에 Lean 4 정형화가 올라갔고, 논문과 LLM이 재구성한 reasoning walkthroughs PDF가 공개되었다. — 본문의 GitHub 링크와 두 개의 PDF 링크에서 정형화 코드와 논문·walkthroughs 파일 접근이 가능함. 출처
- Simon Willison은 Anthropic이 Claude와 Mythos Preview로 암호학적 약점을 찾는 데 약 $100,000를 사용한 사례를 함께 언급하며 두 사례를 비교한다. — 기사 내 Anthropic 관련 하이퍼링크와 원 게시물 링크에서 해당 비용 및 프롬프트 문구 확인 가능. 출처
용어 해설
- Astra
- — OpenAI가 언급한 내부 모델 이름으로, 기사에서는 'their next major model'의 내부 버전이 수학 문제 해결에 투입되었다고 보고된다. 구체적 아키텍처나 파라미터 수는 기사에 없으며 내부 버전이라는 점과 문제 해결 작업에 사용되었다는 사실만 제시된다.
- GPT-5.6 Sol
- — 기사에서 비용 산정의 기준으로 쓰인 모델/가격 표기이며, OpenAI가 각 수학 문제에 대해 'less than $2,000 at GPT-5.6 Sol token prices'를 썼다고 명시된다. 본문은 가격 책정 기준으로만 언급하고 실제 청구 내역은 공개하지 않는다.
- Lean 4
- — 수학 정리를 형식화하여 검증 가능한 증명으로 옮기는 proof assistant 언어로, OpenAI의 결과물은 GitHub 저장소에 Lean 4로 정형화된 증명 파일을 포함한다는 점이 기사에 명시된다. 구체적 코드 내용은 저장소에서 확인 가능하다.
- Mythos Preview
- — Anthropic이 사용한 실험적 인터페이스 또는 제품명으로, Simon Willison은 Mythos Preview를 통해 Claude로 암호학적 약점을 찾는 작업에 약 $100,000의 토큰 비용이 들었다고 지적한다. 기사에서는 해당 실험의 대규모 토큰 지출과 연구형 프롬프트 문구가 강조된다.
- big mathematics(Big mathematics)
- — Terence Tao가 언급한 개념으로, 인간과 기계가 대규모로 분업해 인간은 창의적 결정을 맡고 기계는 기술적 계산과 세부 증명 작업을 수행하는 수학 연구의 전환을 의미한다. 기사에서는 이 개념이 LLM 기반 증명 자동화와 연결되어 논의된다.
기술
- Astra
- GPT-5.6 Sol
- Lean 4
- Mythos Preview
- Claude
활용 사례
- 오래된 수학 난제의 풀이 시도와 증명의 형식적 정형화
- 연구 수준의 대규모 계산·검증 작업에서 LLM을 보조 도구로 활용
- 학계와 산업계 간 기계 보조 수학 협업 워크플로 테스트
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.