{"id":2564,"date":"2026-04-23T18:22:10","date_gmt":"2026-04-23T18:22:10","guid":{"rendered":"https:\/\/deepinsightai.io\/?p=2564"},"modified":"2026-04-23T18:22:12","modified_gmt":"2026-04-23T18:22:12","slug":"deepseek-starts-updating-frequently","status":"publish","type":"post","link":"https:\/\/deepinsightai.io\/de\/deepseek-starts-updating-frequently\/","title":{"rendered":"DeepSeek wird nun regelm\u00e4\u00dfig aktualisiert: Tile-Kernel und DeepEP V2"},"content":{"rendered":"<p>Gerade eben hat DeepSeek\u2019s <a href=\"https:\/\/deepinsightai.io\/de\/the-fake-star-economy-on-github\/\">GitHub<\/a> begann, regelm\u00e4\u00dfig Updates zu ver\u00f6ffentlichen. Es startete ein neues Repository und stellte es als Open Source zur Verf\u00fcgung, <strong>Kachelkerne<\/strong>, und hat gleichzeitig die <strong>DeepEP<\/strong> Repository, wodurch <strong>DeepEP V2<\/strong> online. Es ist noch keine Woche her, seit DeepSeek still und leise ein Update ver\u00f6ffentlicht hat <strong>Mega MoE<\/strong> und <strong>FP4-Indexer<\/strong> das letzte Mal.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">DeepSeek-Kachelkerne<\/h2>\n\n\n\n<figure data-spectra-id=\"spectra-mobt4mso-77si3j\" class=\"wp-block-image aligncenter size-full\"><img fetchpriority=\"high\" decoding=\"async\" width=\"889\" height=\"471\" src=\"https:\/\/deepinsightai.io\/wp-content\/uploads\/2026\/04\/image-59.png\" alt=\"DeepSeek-Kachelkerne\" class=\"wp-image-2568\" srcset=\"https:\/\/deepinsightai.io\/wp-content\/uploads\/2026\/04\/image-59.png 889w, https:\/\/deepinsightai.io\/wp-content\/uploads\/2026\/04\/image-59-300x159.png 300w, https:\/\/deepinsightai.io\/wp-content\/uploads\/2026\/04\/image-59-768x407.png 768w, https:\/\/deepinsightai.io\/wp-content\/uploads\/2026\/04\/image-59-18x10.png 18w\" sizes=\"(max-width: 889px) 100vw, 889px\" \/><\/figure>\n\n\n\n<p>Link: <code>https:\/\/github.com\/deepseek-ai\/TileKernels<\/code><\/p>\n\n\n\n<p>Laut der Einleitung, <strong>Kachelkerne<\/strong> sind GPU-Kerne, die f\u00fcr LLM-Operationen optimiert sind und mit <strong>TileLang<\/strong>. TileLang ist eine dom\u00e4nenspezifische Sprache zur Darstellung leistungsstarker GPU-Kernel in Python, die sich durch einfache Portierbarkeit, agile Entwicklung und automatische Optimierung auszeichnet.<\/p>\n\n\n\n<p>Die Leistung der Tile-Kernel ist au\u00dferordentlich hoch. Wie DeepSeek selbst schrieb: \u201cDie meisten Kernel in diesem Projekt haben hinsichtlich Rechenintensit\u00e4t und Speicherbandbreite bereits fast die Leistungsgrenze der Hardware erreicht. Einige davon wurden intern bereits in Trainings- und Inferenzszenarien eingesetzt. Sie stellen jedoch noch keine Best Practices dar, und wir arbeiten weiterhin daran, die Codequalit\u00e4t und die Dokumentation zu verbessern.\u201d<\/p>\n\n\n\n<p>Das Repository enth\u00e4lt zwar nicht viele einf\u00fchrende Informationen, doch zwischen den Zeilen wird bereits der zugrunde liegende Weg der architektonischen Innovation der DeepSeek-Modelle der n\u00e4chsten Generation \u201cverraten\u201d, was auf einen Sprung hindeutet, der mit dem j\u00fcngsten <a target=\"_blank\" rel=\"noreferrer noopener\" href=\"https:\/\/deepinsightai.io\/de\/hy3-preview-launch\/\">Vorabpr\u00e4sentation von Hy3<\/a>.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\">Funktionen der DeepSeek-Tile-Kernel<\/h3>\n\n\n\n<p>Hier sind einige spezifische Merkmale von Tile-Kerneln:<\/p>\n\n\n\n<p><strong>Gating-Mechanismus:<\/strong> Auswahl der Top-k-Experten und Bewertung f\u00fcr das MoE-Routing<\/p>\n\n\n\n<p><strong>MoE-Routing:<\/strong> Zuordnung von Tokens zu Experten, kombiniertes \u201eExpand\/Reduce\u201c und Gewichtsnormalisierung<\/p>\n\n\n\n<p><strong>Quantisierung:<\/strong> Unterst\u00fctzt die FP8\/FP4\/E5M6-Konvertierung in den Modi \u201epro Token\u201c, \u201epro Block\u201c und \u201epro Kanal\u201c und kombiniert SwiGLU- mit Quantisierungsoperationen<\/p>\n\n\n\n<p><strong>Transponieren:<\/strong> Transponierungsvorg\u00e4nge im Batch-Modus<\/p>\n\n\n\n<p><strong>Engramm:<\/strong> Engramm-Gating-Kernel, Fusion von RMSNorm, Vorw\u00e4rts-\/R\u00fcckw\u00e4rtsausbreitung und Gewichtsgradientenreduktion<\/p>\n\n\n\n<p><strong>Manifold HyperConnection:<\/strong> Hyper-Connection-Kernel, einschlie\u00dflich Sinkhorn-Normalisierung und \u201eSplit\/Apply\u201c f\u00fcr \u201eMix\u201c<\/p>\n\n\n\n<p><strong>Modellierung:<\/strong> Auf hoher Ebene <code>torch.autograd.Function<\/code> Wrapper, die die zugrunde liegenden Kernel zu trainierbaren Schichten zusammenfassen (Engram Gate, mHC-Pipeline)<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">DeepSeek EPv2: Schnelleres EP mit Unterst\u00fctzung f\u00fcr Engram, PP und CP<\/h2>\n\n\n\n<figure data-spectra-id=\"spectra-mobt54cl-th2xp4\" class=\"wp-block-image aligncenter size-large\"><img decoding=\"async\" width=\"1024\" height=\"656\" data-src=\"https:\/\/deepinsightai.io\/wp-content\/uploads\/2026\/04\/image-60-1024x656.png\" alt=\"DeepSeek EPv2: Schnelleres EP mit Unterst\u00fctzung f\u00fcr Engram, PP und CP\" class=\"wp-image-2569 lazyload\" data-srcset=\"https:\/\/deepinsightai.io\/wp-content\/uploads\/2026\/04\/image-60-1024x656.png 1024w, https:\/\/deepinsightai.io\/wp-content\/uploads\/2026\/04\/image-60-300x192.png 300w, https:\/\/deepinsightai.io\/wp-content\/uploads\/2026\/04\/image-60-768x492.png 768w, https:\/\/deepinsightai.io\/wp-content\/uploads\/2026\/04\/image-60-18x12.png 18w, https:\/\/deepinsightai.io\/wp-content\/uploads\/2026\/04\/image-60.png 1069w\" data-sizes=\"(max-width: 1024px) 100vw, 1024px\" src=\"data:image\/svg+xml;base64,PHN2ZyB3aWR0aD0iMSIgaGVpZ2h0PSIxIiB4bWxucz0iaHR0cDovL3d3dy53My5vcmcvMjAwMC9zdmciPjwvc3ZnPg==\" style=\"--smush-placeholder-width: 1024px; --smush-placeholder-aspect-ratio: 1024\/656;\" \/><\/figure>\n\n\n\n<p>EPv2-Link: <code>https:\/\/github.com\/deepseek-ai\/DeepEP\/pull\/605<\/code><\/p>\n\n\n\n<p>Heute fr\u00fch hat DeepSeek au\u00dferdem die neueste Version von <strong>EPv2<\/strong>, wodurch eine schnellere Lieferung gew\u00e4hrleistet wird <strong>Expertenparallellit\u00e4t (EP)<\/strong> sowie Unterst\u00fctzung f\u00fcr <strong>Engramm \/ Pipeline-Parallelit\u00e4t (PP) \/ Kontext-Parallelit\u00e4t (CP)<\/strong>.<\/p>\n\n\n\n<p>Da sich Hardware, Netzwerke und Modellarchitekturen parallel zu raschen Branchenentwicklungen wie <a href=\"https:\/\/deepinsightai.io\/de\/qwen-3-6\/\" target=\"_blank\" rel=\"noreferrer noopener\">Qwen 3.6<\/a>, Die fr\u00fchere Version \u201eDeepEP V1\u201c von DeepSeek hatte bereits zu viel Altlasten und zu viele Leistungsprobleme mit sich gebracht.<\/p>\n\n\n\n<p>Dieses Update f\u00fchrt zu einer vollst\u00e4ndigen Umstrukturierung <strong>Parallelismus f\u00fcr Experten<\/strong>. Im Vergleich zu V1 ben\u00f6tigt es nur einen Bruchteil der SM-Ressourcen, um eine extreme Leistung zu erzielen, und unterst\u00fctzt gleichzeitig gr\u00f6\u00dfere <strong>Skalierung<\/strong> (innerhalb eines einzelnen Rechners) und <strong>Scale-out<\/strong> (auf verschiedenen Rechnern).<\/p>\n\n\n\n<p>Dar\u00fcber hinaus f\u00fchrte DeepSeek eine experimentelle <strong>0 SM<\/strong> Serien in diesem Update, darunter <strong>0 SM-Engramm<\/strong>, <strong>0 SM-Pipeline-Parallelit\u00e4t (PP)<\/strong>, und <strong>0 SM-Kontextparallelit\u00e4t (CP)<\/strong> All-Gather-Operatoren. Gleichzeitig wurde das Backend von <strong>NVSHMEM<\/strong> zum Feuerzeug <strong>NCCL Gin<\/strong> Backend.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\">Neue Funktionen in DeepSeek DeepEP V2<\/h3>\n\n\n\n<p>Hier sind einige der neuen Funktionen in DeepEP V2:<\/p>\n\n\n\n<p><strong>Vollst\u00e4ndig JIT<\/strong><\/p>\n\n\n\n<p><strong>NCCL-Gin-Backend:<\/strong><\/p>\n\n\n\n<p>Nur Header, extrem leicht<\/p>\n\n\n\n<p>M\u00f6glichkeit zur Wiederverwendung bestehender NCCL-Kommunikatoren<\/p>\n\n\n\n<p><strong>EPv2:<\/strong><\/p>\n\n\n\n<p>Vereinheitlicht APIs mit hohem Durchsatz und geringer Latenz in einer einzigen Schnittstelle und nutzt ein v\u00f6llig neues GEMM-Layout<\/p>\n\n\n\n<p>Unterst\u00fctzt gr\u00f6\u00dfere Skalierungsbereiche, bis zu <strong>EP2048<\/strong><\/p>\n\n\n\n<p>F\u00fchrt die analytische Berechnung der SM- und QP-Zahlen ein, sodass eine automatische Abstimmung nicht mehr erforderlich ist<\/p>\n\n\n\n<p>Unterst\u00fctzt weiterhin beides <strong>Hybrid<\/strong> Modus und <strong>Direkt<\/strong> Modus<\/p>\n\n\n\n<p>Bei \u00e4lteren, V3-\u00e4hnlichen Trainingsaufgaben sinkt die SM-Nutzung von <strong>24<\/strong> zu <strong>4\u20136<\/strong>, bei gleichbleibender oder sogar besserer Leistung<\/p>\n\n\n\n<p><strong>0 SM-Engramm<\/strong> (mit RDMA)<\/p>\n\n\n\n<p><strong>0 SM PP<\/strong> (mit RDMA)<\/p>\n\n\n\n<p><strong>0 SM CP<\/strong> (mit Copy Engine)<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Leistung von DeepSeek DeepEP V2<\/h2>\n\n\n\n<p>Nach der Konfiguration von <strong>DeepSeek-V3<\/strong>, wurden Tests unter der neuen Version mit folgenden Einstellungen durchgef\u00fchrt: <strong>8.000 Token pro Charge<\/strong>, <strong>7168 verborgene Dimension<\/strong>, <strong>Die acht besten Experten<\/strong>, <strong>FP8-Meldung<\/strong>, und <strong>M\u00e4hdrescher BF16<\/strong>. Die Ergebnisse lauten wie folgt:<\/p>\n\n\n\n<figure data-spectra-id=\"spectra-mobt5q25-blwgn9\" class=\"wp-block-image aligncenter size-full\"><img decoding=\"async\" width=\"650\" height=\"289\" data-src=\"https:\/\/deepinsightai.io\/wp-content\/uploads\/2026\/04\/image-61.png\" alt=\"Leistung von DeepSeek DeepEP V2\" class=\"wp-image-2570 lazyload\" data-srcset=\"https:\/\/deepinsightai.io\/wp-content\/uploads\/2026\/04\/image-61.png 650w, https:\/\/deepinsightai.io\/wp-content\/uploads\/2026\/04\/image-61-300x133.png 300w, https:\/\/deepinsightai.io\/wp-content\/uploads\/2026\/04\/image-61-18x8.png 18w\" data-sizes=\"(max-width: 650px) 100vw, 650px\" src=\"data:image\/svg+xml;base64,PHN2ZyB3aWR0aD0iMSIgaGVpZ2h0PSIxIiB4bWxucz0iaHR0cDovL3d3dy53My5vcmcvMjAwMC9zdmciPjwvc3ZnPg==\" style=\"--smush-placeholder-width: 650px; --smush-placeholder-aspect-ratio: 650\/289;\" \/><\/figure>\n\n\n\n<p>Hinweis: Die angezeigten Ergebnisse beziehen sich auf die logische Bandbreite. Beispielsweise im Fall von <strong>Folge 8, Folge 2<\/strong>, das <strong>90 GB\/s<\/strong> Die Bandbreite umfasst tats\u00e4chlich auch den Datenverkehr zwischen lokalen GPUs (lokalen Ranks).<\/p>\n\n\n\n<p>Im Vergleich zu V1 erreicht V2 bis zu <strong>1,3-fache Spitzenleistung<\/strong>, und dabei bis zu <strong>4\u00d7 SM-Ressourcenauslastung <\/strong>\u2014eine entscheidende Optimierung, um in einem Umfeld, das von Schwergewichten wie <a href=\"https:\/\/deepinsightai.io\/de\/claude-opus-4-7\/\" target=\"_blank\" rel=\"noreferrer noopener\">Claude Opus 4.7<\/a>.<\/p>\n\n\n\n<p>Zum Schluss noch ein kleiner Tipp f\u00fcr DeepSeek: Beeilt euch und bringt die Version raus <strong>V4<\/strong> Schon. Alle werden langsam ungeduldig.<\/p>\n\n\n\n<p><\/p>","protected":false},"excerpt":{"rendered":"<p>Just now, DeepSeek\u2019s GitHub started updating frequently. It launched and open-sourced a new repository, Tile Kernels, and at the same time updated the DeepEP repository, bringing DeepEP V2 online. It has been less than a week since DeepSeek quietly updated Mega MoE and FP4 Indexer last time. DeepSeek Tile Kernels Link: https:\/\/github.com\/deepseek-ai\/TileKernels According to the [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":2567,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"_seopress_robots_primary_cat":"none","_seopress_titles_title":"%%post_title%%","_seopress_titles_desc":"DeepSeek releases Tile Kernels and DeepEP V2 with faster expert parallelism, 1.3\u00d7 performance boost, and major GPU efficiency gains.","_seopress_robots_index":"","_uag_custom_page_level_css":"","site-sidebar-layout":"default","site-content-layout":"","ast-site-content-layout":"default","site-content-style":"default","site-sidebar-style":"default","ast-global-header-display":"","ast-banner-title-visibility":"","ast-main-header-display":"","ast-hfb-above-header-display":"","ast-hfb-below-header-display":"","ast-hfb-mobile-header-display":"","site-post-title":"","ast-breadcrumbs-content":"","ast-featured-img":"","footer-sml-layout":"","ast-disable-related-posts":"","theme-transparent-header-meta":"","adv-header-id-meta":"","stick-header-meta":"","header-above-stick-meta":"","header-main-stick-meta":"","header-below-stick-meta":"","astra-migrate-meta-layouts":"set","ast-page-background-enabled":"default","ast-page-background-meta":{"desktop":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"ast-content-background-meta":{"desktop":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"tablet":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""},"mobile":{"background-color":"var(--ast-global-color-5)","background-image":"","background-repeat":"repeat","background-position":"center center","background-size":"auto","background-attachment":"scroll","background-type":"","background-media":"","overlay-type":"","overlay-color":"","overlay-opacity":"","overlay-gradient":""}},"footnotes":""},"categories":[2,10],"tags":[],"class_list":["post-2564","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-news","category-llm"],"uagb_featured_image_src":{"full":["https:\/\/deepinsightai.io\/wp-content\/uploads\/2026\/04\/deepseek.png",786,520,false],"thumbnail":["https:\/\/deepinsightai.io\/wp-content\/uploads\/2026\/04\/deepseek-150x150.png",150,150,true],"medium":["https:\/\/deepinsightai.io\/wp-content\/uploads\/2026\/04\/deepseek-300x198.png",300,198,true],"medium_large":["https:\/\/deepinsightai.io\/wp-content\/uploads\/2026\/04\/deepseek-768x508.png",768,508,true],"large":["https:\/\/deepinsightai.io\/wp-content\/uploads\/2026\/04\/deepseek.png",786,520,false],"1536x1536":["https:\/\/deepinsightai.io\/wp-content\/uploads\/2026\/04\/deepseek.png",786,520,false],"2048x2048":["https:\/\/deepinsightai.io\/wp-content\/uploads\/2026\/04\/deepseek.png",786,520,false],"trp-custom-language-flag":["https:\/\/deepinsightai.io\/wp-content\/uploads\/2026\/04\/deepseek-18x12.png",18,12,true]},"uagb_author_info":{"display_name":"Claude Carter","author_link":"https:\/\/deepinsightai.io\/de\/author\/cloud-han03gmail-com\/"},"uagb_comment_info":0,"uagb_excerpt":"Just now, DeepSeek\u2019s GitHub started updating frequently. It launched and open-sourced a new repository, Tile Kernels, and at the same time updated the DeepEP repository, bringing DeepEP V2 online. It has been less than a week since DeepSeek quietly updated Mega MoE and FP4 Indexer last time. DeepSeek Tile Kernels Link: https:\/\/github.com\/deepseek-ai\/TileKernels According to the&hellip;","_links":{"self":[{"href":"https:\/\/deepinsightai.io\/de\/wp-json\/wp\/v2\/posts\/2564","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/deepinsightai.io\/de\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/deepinsightai.io\/de\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/deepinsightai.io\/de\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/deepinsightai.io\/de\/wp-json\/wp\/v2\/comments?post=2564"}],"version-history":[{"count":1,"href":"https:\/\/deepinsightai.io\/de\/wp-json\/wp\/v2\/posts\/2564\/revisions"}],"predecessor-version":[{"id":2571,"href":"https:\/\/deepinsightai.io\/de\/wp-json\/wp\/v2\/posts\/2564\/revisions\/2571"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/deepinsightai.io\/de\/wp-json\/wp\/v2\/media\/2567"}],"wp:attachment":[{"href":"https:\/\/deepinsightai.io\/de\/wp-json\/wp\/v2\/media?parent=2564"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/deepinsightai.io\/de\/wp-json\/wp\/v2\/categories?post=2564"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/deepinsightai.io\/de\/wp-json\/wp\/v2\/tags?post=2564"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}