DeepSeek는 2026년 9월 10일 긴 컨텍스트와 도구 사용, 멀티모달 입력을 겨냥한 API 모델 DeepSeek V4.1 Flash를 발표했다. 공식 설명에 따르면 총 552B 파라미터의 Mixture-of-Experts(MoE)를 사용하며 프리필 단계에서는 약 8B, 디코딩 단계에서는 약 16B가 활성화된다. 네이티브 시각 이해도 포함한다. 연구용 이름만 공개된 것이 아니라 API가 제공 중이어서 개발자는 공식 경로에서 실제 요청을 시험할 수 있다.
이번에 실제로 공개된 것은 무엇인가
제품의 핵심은 텍스트와 이미지 이해를 하나의 API 워크플로로 묶는 것이다. 앱은 문서나 화면, 차트, 사진을 질문과 함께 보낼 수 있어 매번 별도 서비스로 변환하는 과정이 줄어든다. 긴 컨텍스트와 에이전트 작업, 도구 호출도 설계 방향으로 제시됐지만 실제 경험은 엔드포인트와 계정, 문서화된 제한에 좌우된다.
MoE를 쓴다고 해서 모든 요청에서 552B 전체가 활성화되는 것은 아니다. DeepSeek가 공개한 활성 파라미터 수치는 대형 모델의 용량과 요청당 계산량을 결합하려는 설계를 보여준다. 모든 기기와 프롬프트, 작업에서 같은 속도를 보장하는 수치가 아니며 품질은 작업과 입력 형식, 서버 스케줄링에도 달려 있다.
Flash의 핵심은 효율성과 메모리
DeepSeek는 V4.1 Flash의 KV 캐시를 특히 강조한다. 이전 구성과 비교해 캐시 사용량을 HBM은 약 4분의 1, SSD는 약 8분의 1로 낮출 수 있다고 설명한다. 제한된 가속기 메모리에서 긴 컨텍스트 서비스를 쉽게 제공하려는 목표이며 배포 비용과 동시 처리량, 대규모 문서·장문 대화 작업의 모델 선택에 영향을 준다.
따라서 ‘552B’만으로 서비스가 비싼지 싼지 판단할 수 없다. 총 파라미터는 용량을 설명하고 활성 파라미터와 캐시 구조가 요청 처리의 계산·메모리 비용에 더 가깝다. 기업은 토큰 단가와 입출력 비율, 지연 시간, 처리량, 데이터 처리 위치를 함께 비교해야 한다.
API는 제공 중이지만 가격과 라우팅을 봐야 한다
DeepSeek는 V4.1 Flash API 경로와 새 가격을 공개해 개발자가 모델 다운로드나 비공개 대기열을 거치지 않고 시험할 수 있게 했다. 또한 V4.1 Pro가 나오기 전인 9월 14일 04:00 UTC부터 V4 Pro 요청을 일시적으로 V4.1 Flash로 보내고 Flash 가격을 적용한다고 설명했다. 이는 서비스 라우팅 정책이지 Pro와 Flash가 완전히 같다는 뜻은 아니다.
PoC를 만드는 팀이 확인할 실무 항목은 모델 이름보다 API 문서의 컨텍스트 한도와 이미지 형식, 속도 제한, 데이터 보존 정책, 지역별 제공 여부다. 발표에서 ‘이용 가능’하다는 말은 엔드포인트가 제공된다는 뜻이지 모든 계정과 지역, SDK가 같은 날 같은 기능을 가진다는 보장은 아니다.
개발자에게 어떤 의미인가
V4.1 Flash는 긴 컨텍스트와 이미지 이해가 필요하면서 추론 비용을 관리해야 하는 워크플로에 적합하다. 기술 문서 질의응답과 시각 보고서 정리, 고객 문의 분류, 이미지 인식 에이전트가 예다. 전문 비전 모델을 자동으로 대체하거나 모든 추론 작업에서 우위를 보장하는 것은 아니므로 자체 데이터의 A/B 테스트가 필요하다.
이번 발표의 핵심은 모델 능력과 메모리 효율, API 사업 조건을 하나의 제품 업데이트로 묶었다는 점이다. IAM 독자에게 중요한 기준은 가장 큰 파라미터 수가 아니라 자신의 데이터와 지연 시간, 예산 조건에서 작업을 안정적으로 완료하는지다.
