**DeepSeek-V4-Flash-Vision-Exp: Az első kísérleti multimodális modell a DeepSeek-V4 családban**
A DeepSeek bemutatta a DeepSeek-V4-Flash-Vision-Exp modellt, amely a DeepSeek-V4 család első kísérleti multimodális modellje. Ez a modell a DeepSeek-V4-Flash architektúrára épül, vizuális modulokkal kiegészítve és folyamatos tanítással fejlesztve a vizuális megértési képességeket. A DeepSeek-V4-Flash-0731 verzióhoz képest jelentős javulást ér el a multimodális ügynök-képességekben, miközben a szöveges ügynök-feladatokban hasonló teljesítményt nyújt. A benchmark eredmények szerint a multimodális ügynök-képességek terén kiemelkedő előrelépés tapasztalható: az ApexBench (Pass@1) mutató 26,2-ről 36,5-re nőtt, a Chartography 64,3-as értéket ér el, a ZeroBench (Pass@5) pedig 35,0-et mutat. A szöveges ügynök-képességekben a Terminal Bench 2.1 83,9-es, a DeepSWE 59,3-as, a Toolathlon-Verified 75,9-es eredményt ért el, ami stabil, versenyképes teljesítményt jelez az olyan modellekkel szemben, mint az Opus-4.8.
A modell repository felépítése tartalmazza a tokenizert, a prompt-kódolási referenciát és egy minimális PyTorch inferencia-implementációt, amely lefedi a vision encoder és aligner, a DFlash attention, a MoE, a Hyper-Connections és a DSpark forward útvonalat. A prompt-kódolás támogatja mind az OpenAI-stílusú JSON tartalomblokkokat, mind a kompakt `
A modell futtatásához két fő lehetőség kínálkozik: a vLLM és az SGLang keretrendszerek. A vLLM esetében például egy 4×GB300 csomóponton történő kiszolgáláshoz Docker parancs áll rendelkezésre, amely tartalmazza a kv-cache fp8 típusát, a 256-os blokkméretet, a 4-es tensor-parallel méretet, valamint a deepseek_v4 tool-call és reasoning parsereket, továbbá a DSpark speculatív konfigurációt. Az SGLang esetében a DSpark engedélyezéséhez a `–speculative-algorithm DSPARK` kapcsoló szükséges, és nem kell külön `–speculative-draft-model-path`-ot megadni, mivel a cél- és draft-súlyok ugyanabból a checkpointból származnak. A repository MIT licenc alatt érhető el, részletes utasítások pedig a vLLM recipe-ben és az SGLang cookbookban találhatók a különböző hardverkonfigurációkhoz és benchmarkokhoz.
Ez a cikk a Neural News AI (V1) verziójával készült.
Forrás: https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp.
A képet Marek Lumi készítette, mely az Unsplash-on található.