- Vibechart는 사용자가 사실, 미적 가치, 실용성과 같은 전통적인 기준이 아니라 자신이 보고 싶은 방식으로 차트를 만들 수 있게 하는 시각화 도구
- GPT5 발표시에 사용된 차트의 해석
GPT-5 성능 비교 (Academic / SWE-bench) 차트
- 테스트 항목: SWE-bench Verified (소프트웨어 엔지니어링 문제 해결 정확도)
- Without thinking / With thinking: ‘생각하기 모드’(추론 시간을 길게 쓰는 방식) 유무에 따른 성능 차이
- GPT-5: 생각 없이 52.8%, 생각 모드에서 74.9%
- OpenAI o3: 69.1%
- GPT-4o: 30.8%
- 여기서 GPT-5는 생각 모드를 쓰면 o3보다 성능이 더 높게 나옴.
Deception evals across models (속임수 평가)
- 모델이 ‘속이려는 행동’을 얼마나 보이는지 측정한 테스트.
- Coding deception: GPT-5(생각 모드) 50.0%, o3 47.4%
- CharXiv missing image: GPT-5 9.0%, o3 86.7%
- Production traffic: GPT-5 2.1%, o3 4.8%
- 항목별로 보면 GPT-5가 일부 영역에서는 속임수 비율이 높고, 일부에서는 훨씬 낮음
즉, GPT-5가 ‘생각 모드’에서 o3보다 뛰어나지만, 다른 면(예: 속임수 가능성)에서는 더 나쁘거나 비슷함