- 신영선
- 기본 과정
- Chat GPT 4.1
새로 출시된 GPT 4.1 모델 공략집
Open ai가 인정한 최고의 가성비 GPT 4.1 모델
- 릴스 영상을 저장 또는 공유하기로 기록 해놓습니다.
- DM으로 받은 링크를 카톡으로 옮겨 놓습니다.
- PC로 접속해서 AI 즐겨찾기 폴더를 만들어 저장해놓습니다.
- 바로 사용을 해봅니다. 절대 미루지 마세요. (⭐ 제일 중요)
1. 공식 자료
Introducing GPT-4.1 in the APIIntroducing GPT-4.1 in the API—a new family of models with across-the-board improvements, including major gains in coding, instruction following, and long-conte2. 번역본
오늘, 우리는 세 가지 새로운 API 모델을 출시합니다: GPT‑4.1, GPT‑4.1 mini, GPT‑4.1 nano.
이 모델들은 GPT‑4o 및 GPT‑4o mini를 전반적으로 능가하며, 코딩과 지시사항 이행 능력에서 특히 뛰어납니다. 최대 100만 토큰의 컨텍스트 윈도우를 지원하며, 해당 정보를 훨씬 더 잘 이해하고 활용할 수 있습니다. 또한 2024년 6월로 지식 커트오프가 업데이트되었습니다.
GPT-4.1 시리즈 개요
신규 모델: GPT-4.1 / mini / nano
공통 성능 특징:
GPT-4o 시리즈 대비 전반적 성능 향상
최대 100만 토큰의 초장기 문맥 이해력
지시 이행, 코딩, 장기문맥 처리, 시각이해, 비용 효율성 개선
지식 커트오프: 2024년 6월
1. 코딩 성능 (소프트웨어 개발, 코드 리뷰 등)
SWE-bench Verified 기준:
GPT-4.1: 54.6%
GPT-4o: 33.2%
GPT-4.5: 38%
코드 diff 처리:
GPT-4.1은 파일 전체 수정보다 변경 라인만 추출하는 diff 출력에 특화
Aider diff benchmark 기준 GPT-4.5보다 8%p 우위
프론트엔드 개발:
GPT-4.1로 만든 웹앱이 GPT-4o보다 80% 더 선호됨
현장 활용 사례:
Windsurf: 코드 승인율 +60%
Qodo: 코드 리뷰 정밀도 및 완성도 모두 GPT-4.1 우세
2. 지시사항 이행 능력
형식/순서/내용/부정 지시 등 다양한 지시 따라하기 향상
OpenAI 내부 평가: GPT-4.1이 'hard prompts'에서 GPT-4o 대비 20%p 우위
Multi-turn 대화 유지 (Scale의 MultiChallenge):
GPT-4.1: 38.3%
GPT-4o: 28%
IFEval (지시사항 엄수율):
GPT-4.1: 87.4%
GPT-4o: 81%
현장 사례:
Blue J: 세금 규정 해석 정확도 +53%
Hex: SQL 처리 정확도 2배 향상
3. 장기 문맥 이해력 (100만 토큰까지!)
Needle in haystack 실험에서 100만 토큰 내 정보도 정확히 찾아냄
OpenAI MRCR (복수 질문 구분) 및 **Graphwalks (멀티 홉 그래프 추론)**에서 GPT-4.1 성능 우세
실제 활용:
Thomson Reuters: 문서 간 상관관계 이해력 +17%
Carlyle: 대규모 재무 문서 분석 정확도 +50%
4. 이미지 및 멀티모달 이해
MMMU, MathVista, CharXiv Reasoning 등의 이미지+지식 기반 벤치마크에서 GPT-4.1 mini가 GPT-4o 초과
Video-MME (자막 없는 30–60분 영상 이해):
GPT-4.1: 72%
GPT-4o: 65%
5. 응답 속도 및 비용 효율성
| 모델 | 입력 | 캐시 입력 | 출력 | 혼합 평균 비용 (1M 토큰 기준) |
| GPT-4.1 | $2.00 | $0.50 | $8.00 | $1.84 |
| GPT-4.1 mini | $0.40 | $0.10 | $1.60 | $0.42 |
| GPT-4.1 nano | $0.10 | $0.025 | $0.40 | $0.12 |
- *prompt caching 할인율 75%**로 증가
GPT-4.5 Preview는 2025년 7월 14일 종료 예정
📊 이미지 번역 요약
[1] Academic Knowledge (학술 지식 성능)
| 항목 | GPT‑4.1 | 4.1 mini | 4.1 nano |
| AIME’24 | 48.1% | 49.6% | 29.4% |
| GPQA Diamond | 66.3% | 65.0% | 50.3% |
| MMLU | 90.2% | 87.5% | 80.1% |
| 다국어 MMLU | 87.3% | 78.5% | 66.9% |
GPT-4.1은 학술 평가에서 GPT-4o 및 이전 모델 대비 전반적으로 우위.
[2] Coding Evals (코딩 관련 평가)
| 항목 | GPT‑4.1 | 4.1 mini | 4.1 nano |
| SWE-bench Verified | 54.6% | 23.6% | - |
| SWE-Lancer | $176K (35.1%) | $165K (33.0%) | $77K (15.3%) |
| SWE-Lancer (IC) | $34K (14.4%) | $31K (13.1%) | $9K (3.7%) |
| Aider’s polyglot: whole | 51.6% | 34.7% | 9.8% |
| Aider’s polyglot: diff | 52.9% | 31.6% | 6.2% |
GPT-4.1은 실전 코딩 문제 해결과 diff 형식 코드 편집에서 가장 뛰어난 성능.
[3] Instruction Following (지시 이행 능력)
| 항목 | GPT‑4.1 | 4.1 mini | 4.1 nano |
| API 지시 이행 (hard) | 49.1% | 45.1% | 31.6% |
| MultiChallenge | 38.3% | 35.8% | 15.0% |
| MultiChallenge (mini 채점) | 46.2% | 42.2% | 31.1% |
| COLLIE | 65.8% | 54.6% | 42.5% |
| IFEval | 87.4% | 84.1% | 73.5% |
| Multi-IF | 70.8% | 67.0% | 57.2% |
지시 형식, 조건, 회피 지시 등 다양한 프롬프트에 GPT-4.1이 강하게 반응.
[4] Long Context (초장기 문맥 이해)
| 항목 | GPT‑4.1 | 4.1 mini | 4.1 nano |
| MRCR (2 needle, 128k) | 57.2% | 47.2% | 36.6% |
| MRCR (2 needle, 1M) | 46.3% | 33.3% | 12.0% |
| Graphwalks bfs <128k | 61.7% | 61.7% | 25.0% |
| Graphwalks bfs >128k | 19.0% | 15.0% | 2.9% |
| Graphwalks parents <128k | 58.0% | 60.5% | 9.4% |
| Graphwalks parents >128k | 25.0% | 11.0% | 5.6% |
GPT-4.1은 100만 토큰에서도 정보 추출 및 멀티홉 reasoning에서 안정적인 성능을 보임.
[5] Vision & Function Calling (시각 이해 + 함수 호출)
📷 Vision
| 항목 | GPT‑4.1 | 4.1 mini | 4.1 nano |
| MMMU | 74.8% | 72.7% | 55.4% |
| MathVista | 72.2% | 73.1% | 56.2% |
| CharXiv-R | 56.7% | 56.8% | 40.5% |
| CharXiv-D | 87.9% | 88.4% | 73.9% |
⚙️ Function Calling
| 항목 | GPT‑4.1 | 4.1 mini | 4.1 nano |
| ComplexFuncBench | 65.5% | 49.3% | 0.6% |
| Taubench airline | 49.4% | 36.0% | 14.0% |
| Taubench retail | 68.0% (73.6%) | 55.8% (64.5%) | 22.6% (23.5%) |
GPT-4.1은 시각적 추론 및 함수 호출 능력에서도 가장 높은 정답률 보임.
GPT‑4.1 모델군 요약 (3,000자 이내)
개요
GPT‑4.1, GPT‑4.1 mini, GPT‑4.1 nano는 모두 GPT‑4o 및 GPT‑4.5보다 전반적인 성능에서 우위에 있는 OpenAI 최신 모델군입니다. 특히 코딩, 지시사항 이행, 장기 문맥 처리, 시각 이해, 함수 호출 영역에서 큰 진보를 보여주며, 비용과 응답속도 또한 개선되었습니다.
💡 핵심 성능 요약
✅ 1. 코딩
SWE-bench 기준 GPT‑4.1은 54.6%로 GPT‑4o(33.2%) 대비 21.4%p 향상.
Aider의 diff 기반 편집 처리도 2배 이상 정확.
코드 품질, 형식 준수, 불필요한 수정 감소 측면에서도 개선.
✅ 2. 지시 이행
복잡한 지시사항(형식, 순서, 제외조건 등) 이행률 49.1%
MultiChallenge, IFEval, COLLIE 모두에서 GPT-4o 대비 10%p 이상 우위
대화형 API 응답과 연속적인 맥락 유지에도 강함
✅ 3. 초장기 문맥 이해 (최대 100만 토큰)
GPT-4.1은 Graphwalks 및 OpenAI MRCR 기준으로도 GPT-4o보다 20~25%p 높은 정확도
다중 문서 간 정보 참조, 추론, 문맥 유지 모두에 적합
✅ 4. 시각 이해
차트/그래프/수학적 시각 문제 처리에서 GPT-4o 대비 5~10%p 향상
MMMU 74.8%, MathVista 72.2%, CharXiv-D 87.9%로 GPT-4.5와 동급 수준
✅ 5. 함수 호출 (Function Calling)
복합 함수 실행 시 정확도: 65.5%
실제 API 기능 처리, 데이터 기반 행동 실행 등 에이전트 응용 가능성 ↑
⚙️ 모델 선택 가이드
| 모델 | 특징 | 적합한 용도 |
| GPT‑4.1 | 최고 성능, 최장 문맥 | 대규모 문서분석, 고정밀 코딩, 전문 에이전트 |
| GPT‑4.1 mini | 속도 ↑, 비용 ↓, 성능 중상급 | 실시간 반응형 앱, 일반용 서비스 |
| GPT‑4.1 nano | 가장 빠르고 저렴함 | 간단한 분류, 자동완성, 반복작업 처리 |
3. 핵심 요약본
GPT-4.1 시리즈는 코드 작성, 지시 이행, 멀티턴 대화, 장기문맥, 멀티모달 처리에서 모두 향상됨
최고의 가성비, 최신 성능, 강력한 장기 컨텍스트 활용 능력
API 전용으로 제공되며, ChatGPT에서는 점진적 기능 반영 중
이런 자료를 이메일로 받아보시겠습니까? 무료 강의 안내도 같이 갑니다.
무료로 신청하기