방금 전, DeepSeek의 GitHub 자주 업데이트하기 시작했습니다. 새로운 저장소를 출시하고 오픈소스로 공개했으며, 타일 커널, 그리고 동시에 다음을 업데이트했으며 DeepEP 저장소, 이를 통해 DeepEP V2 온라인에서. DeepSeek이 조용히 업데이트한 지 일주일도 채 되지 않았습니다. 메가 MoE 그리고 FP4 인덱서 지난번.
DeepSeek 타일 커널

링크: https://github.com/deepseek-ai/TileKernels
서문에 따르면, 타일 커널 LLM 연산에 최적화된 GPU 커널로, 다음을 사용하여 구축되었으며 TileLang. TileLang은 파이썬으로 고성능 GPU 커널을 표현하기 위한 도메인 특정 언어(DSL)로, 쉬운 이식성, 민첩한 개발, 자동 최적화 등의 특징을 갖추고 있습니다.
Tile 커널의 성능은 매우 뛰어납니다. DeepSeek 측이 직접 밝힌 바와 같이: “이 프로젝트에 포함된 대부분의 커널은 연산 집약도와 메모리 대역폭 측면에서 이미 하드웨어 성능 한계에 근접해 있습니다. 그중 일부는 이미 내부적으로 훈련 및 추론 시나리오에 사용되고 있습니다. 하지만 아직 모범 사례로 자리 잡은 것은 아니며, 저희는 코드 품질과 문서화를 지속적으로 개선해 나가고 있습니다.”
저장소에는 소개 정보가 많지 않지만, 행간을 읽어보면 이미 DeepSeek의 차세대 모델이 따를 아키텍처 혁신의 방향이 “미리 드러나” 있으며, 이는 최근의 […], […], […], […], […], […], […], […], […], […], […], […], […], […], […], […], […], […], […], […], […], […], […], […], […], […], […], […], […], […], […], […], […], […], […], […], […], […], […], […], […], […], […], […], […], […], […], […], […], […], […], […], […], […], […], […], […], […], […], […], […], […], […], […], Hy3 출시 미리보기.
DeepSeek 타일 커널의 특징
다음은 타일 커널의 몇 가지 구체적인 특징입니다:
게이팅 메커니즘: MoE 라우팅을 위한 상위 k 전문가 선정 및 점수 산정
MoE 라우팅: 토큰과 전문가 간의 매핑, 통합된 확장/축소, 가중치 정규화
양자화: 토큰 단위, 블록 단위, 채널 단위 모드에서 FP8/FP4/E5M6 변환을 지원하며, SwiGLU 연산과 양자화 연산을 통합합니다.
전치: 일괄 전치 연산
엔그램: 엔그램 게이트 커널, RMSNorm 융합, 전방/후방 전파, 가중치 기울기 감소
매니폴드 하이퍼커넥션: Sinkhorn 정규화 및 믹싱을 위한 split/apply를 포함한 하이퍼-커넥션 커널
모델링: 고수준 torch.autograd.Function 기본 커널을 학습 가능한 레이어로 결합하는 래퍼(엔그램 게이트, mHC 파이프라인)
DeepSeek EPv2: 엔그램(Engram), PP 및 CP를 지원하는 더 빠른 EP

EPv2 링크: https://github.com/deepseek-ai/DeepEP/pull/605
오늘 오전, DeepSeek은 또한 최신 버전의 EPv2, 더 빠르게 제공하며 전문가 병렬 처리(EP) 그리고 다음을 위한 지원 엔그램 / 파이프라인 병렬 처리(PP) / 컨텍스트 병렬 처리(CP).
하드웨어, 네트워크, 모델 아키텍처가 다음과 같은 업계의 급속한 출시와 함께 발전해 왔습니다. Qwen 3.6, DeepSeek의 이전 버전인 DeepEP V1은 이미 지나치게 많은 과거의 문제점과 성능상의 결함을 안고 있었습니다.
이번 업데이트를 통해 완전히 개편됩니다 전문적인 병렬 처리. V1과 비교했을 때, 극한의 성능을 달성하는 데 필요한 SM 리소스는 극히 일부에 불과할 뿐만 아니라, 더 대규모의 확대 (단일 시스템 내에서) 그리고 확장 (여러 기기에서).
또한 DeepSeek은 실험적인 기능을 도입했는데, 0 SM 이번 업데이트에 포함된 시리즈로는 다음과 같은 것들이 있습니다. 0 SM 엔그램, 0 SM 파이프라인 병렬성(PP), 그리고 0 SM 컨텍스트 병렬 처리(CP) 전체 모음 연산자. 이와 동시에 백엔드가 NVSHMEM 라이터 쪽으로 NCCL 진 백엔드.
DeepSeek DeepEP V2의 새로운 기능
DeepEP V2의 새로운 기능 중 일부는 다음과 같습니다:
완전 JIT
NCCL Gin 백엔드:
헤더만 포함된, 매우 가벼운
기존 NCCL 커뮤니케이터를 재사용할 수 있음
EPv2:
고처리량 및 저지연 API를 단일 인터페이스로 통합하고, 완전히 새로운 GEMM 레이아웃을 채택합니다.
더 큰 스케일링 영역을 지원하며, 최대 EP2048
분석용 SM 및 QP 개수 계산 기능을 도입하여 더 이상 자동 튜닝이 필요하지 않습니다.
양쪽 모두를 계속 지원합니다 하이브리드 모드 및 직접 모드
기존의 V3와 유사한 훈련 과제의 경우, SM 사용량은 24 ~에 4–6, 성능은 동일하거나 오히려 더 향상된 상태를 유지하면서
0 SM 엔그램 (RDMA 사용 시)
0 SM PP (RDMA 사용 시)
0 SM CP (Copy Engine 포함)
DeepSeek DeepEP V2 성능
다음과 같이 설정을 마친 후 DeepSeek-V3, 새로운 버전에서 다음 설정을 적용하여 테스트를 실행했으며 배치당 8K 토큰, 7168 숨겨진 차원, 최고의 전문가 8인, FP8 발송, 그리고 BF16 콤바인. 결과는 다음과 같습니다:

참고: 표시된 결과는 논리적 대역폭입니다. 예를 들어, EP 8 x 2, 그 90 GB/s 대역폭에는 실제로 로컬 GPU 간(로컬 랭크 간) 트래픽도 포함됩니다.
V1과 비교했을 때, V2는 최대 1.3배의 최고 성능, 동시에 최대 4배의 SM 리소스 사용량 —와 같은 거대 기업들이 주도하는 시장에서 경쟁력을 유지하기 위한 핵심적인 최적화 방안으로 클로드 오푸스 4.7.
마지막으로, DeepSeek에 드리는 조언 한 가지: 서둘러 출시해 주세요 V4 벌써. 다들 조바심을 내고 있어요.


