DeepSeek-V3.2-Exp, най-новият модел на китайския чатбот, въвежда DSA, ефективност, API и внедряване.

  • V3.2-Exp въвежда DSA за ускоряване на дългия контекст с минимална загуба на качество.
  • Паритет на производителността с V3.1-Terminus и ценообразуване на API -50% вече са достъпни.
  • Отворен код: тегла в Hugging Face, ядра в TileLang, DeepGEMM и FlashMLA.
  • Практическо ръководство: крайни точки, стрийминг, извикване на функции и локално изпълнение.

DeepSeek-V3.2-Exp

DeepSeek-V3.2-Exp се появи като експериментална версия, фокусирана върху мащабна ефективност и дългосрочни контексти, с ясен препратка към общността: отворен код, публикувани ядра и по-евтин API.

Отвъд шума около него, ключовото е, че този модел, базиран на V3.1-Terminus , дебютира с финозърнест механизъм за разредено внимание, наречен DeepSeek Sparse Attention (DSA), който ускорява обучението и изводите, като същевременно запазва качеството. Компанията вече го е внедрила в своите приложения, уеб и API и е намалила цените за ползване с повече от 50% - агресивен ход, който, честно казано, оказва натиск върху конкуренцията.

Ключови нови функции на DeepSeek-V3.2-Exp

Водещата иновация е DSA, която позволява селективно внимание към съответните части от контекста, без изчерпателно сканиране на цялата последователност. Според компанията, въздействието върху качеството е минимално, докато печалбата в ефективността в дългосрочен контекст е значителна.

По отношение на наличността, моделът е оперативен в приложения, уеб и API от първия ден, придружен от значително намаление на цената (50%+), за да се улесни тестването и внедряването. За тези, които желаят да сравнят, DeepSeek поддържа временна крайна точка за V3.1-Terminus до 15 октомври 2025 г., 15:59 UTC.

Производителност и бенчмаркове на DeepSeek-V3.2-Exp: паритет с V3.1-Terminus

DeepSeek се стреми да постигне паритет с V3.1-Terminus в широк спектър от тестове, по-специално за да изолира ефекта от въвеждането на разсеяно внимание. На практика това се превръща в сравними показатели в разсъжденията, кодирането и използването на инструменти, подобни на агенти.

Различни източници посочват цифри, които помагат за стабилизиране на очакванията: V3.2-Exp е описан като модел с 685 милиарда параметъра и подобна или леко варираща производителност в зависимост от областта. При безинструментално разсъждение се цитират резултати като 85.0 в MMLU-Pro и 89.3 в AIME 2025 ; в сценарии, базирани на агенти, се появяват резултати от 40.1 в BrowseComp и 67.8 в SWE Verified . Тези резултати съответстват на официалния наратив за приоритизиране на ефективността пред значителен скок в точността.

Има дори добри сравнения: при задачите за кодиране се споменава покачване до 2121 в Codeforces в сравнение с 2046, докато при тестове, по-фокусирани върху хуманитарните науки, се наблюдават леки спадове (напр. 19.8 спрямо 21.7 в Humanity's Last Exam). Като цяло, графиката предполага баланс : случайни подобрения и малки отстъпки, като скоростта е ключовият фактор.

DSA: Фино разпръснато внимание, казано ясно

Традиционното внимание става скъпо в широк контекст; DSA минимизира работата там, където допринася малко. Чрез прилагане на разреденост с фин контрол, моделът концентрира изчисленията там, където действително намира сигнал, подобрявайки латентността и намалявайки потреблението, без да изкривява изхода.

В реалния свят това е най-забележимо при задачи, изискващи интензивен контекст : обобщаване на дълги документи, анализ на лог файлове, агенти, участващи в дълги диалози, или конвейери, които комбинират извличане и генериране. В тези ситуации ефективността не е лукс; тя е разликата между това дали нещо е използваемо в голям мащаб или не.

Наличност, цени и сравнения на DeepSeek-V3.2-Exp

DeepSeek обяви, че версия 3.2-Exp вече е достъпна за приложения, уеб и API . Освен това, те са намалили цената на API с повече от 50% , считано от момента на въвеждане, като целта е да се разшири приемането и да се насърчи бенчмарк тестването.

За тези, които желаят да сравнят с предишния модел, V3.1-Terminus остава временна крайна точка до 15.10.2025 г. 15:59 (UTC). Компанията също така насърчава обратната връзка чрез публична форма, засилвайки динамиката на непрекъснато усъвършенстване с общността.

Статус с отворен код: тегла, технически доклад и ядра

DeepSeek публикува модела в Hugging Face, заедно с технически доклад, документиращ промените и резултатите. Съществува ясен ангажимент за прозрачност и насърчаване на дългосрочни приложни изследвания на по-ниски разходи.

На ниво ядро ​​има два пътя: TileLang за по-достъпно четене и създаване на прототипи и CUDA за максимална производителност. Ядрата с логит индекс (включително варианти с страници) са в DeepGEMM , докато ядрата с разредено внимание се публикуват във FlashMLA . Това разделяне улеснява изследователските и производствените общности да намерят своята ниша.

Локално изпълнение на DeepSeek-V3.2-Exp и демонстрации на изводи

DeepSeek предлага хранилище за изводи с актуализирана демонстрация, за да започнете бързо и да инспектирате архитектурата. Първата стъпка е да конвертирате теглата на Hugging Face във формата, очакван от демонстрацията, като дефинирате броя на експертите и паралелизма на модела.

Примерни команди за интерактивно преобразуване и генериране (задайте EXPERTS=256 и MP на броя на графичните процесори): могат да се използват както са в подготвена среда.

cd inference export ЕКСПЕРТИ=256 python convert.py --hf-ckpt-path ${HF_CKPT_PATH} --save-path ${SAVE_PATH} --n-експерти ${ЕКСПЕРТИ} --model-parallel ${MP} export CONFIG=config_671B_v3.2.json torchrun --nproc-per-node ${MP} generate.py --ckpt-path ${SAVE_PATH} --config ${CONFIG} --interactive

За тези, които предпочитат SGLang , има предварително направени образи и команда за зареждане. Съвместимостта включва графични процесори NVIDIA (H200), AMD (MI350) и някои NPU със специфични тагове.

# H200 docker pull lmsysorg/sglang:dsv32 # MI350 docker pull lmsysorg/sglang:dsv32-rocm # NPU docker pull lmsysorg/sglang:dsv32-a2 docker pull lmsysorg/sglang:dsv32-a3 python -m sglang.launch_server --model deepseek-ai/DeepSeek-V3.2-Exp --tp 8 --dp 8 --page-size 64

Ако предпочитате vLLM , той има поддръжка от първия ден. Препоръчително е да прегледате официалните рецепти за актуални параметри и хардуерни оптимизации .

API: Крайни точки, съвместимост и срокове на валидност

DeepSeek API следва стандартните конвенции и е съвместим с популярни SDK. По подразбиране, използването на базовия URL адрес https://api.deepseek.com сочи към V3.2-Exp, което опростява първоначалната интеграция и достъпа до намалената тарифа.

За бенчмаркинг има временна крайна точка за V3.1-Terminus: https://api.deepseek.com/v3.1_terminus_expires_on_20251015 . Имайте предвид датата и часа на изтичане (15 октомври 2025 г., 15:59 UTC), когато планирате бенчмаркове.

Освен това, има съвместимост с екосистемата Anthropic . Можете да използвате базата https://api.deepseek.com/anthropic за взаимодействия в стил Claude или варианта, свързан с временната крайна точка, ако е необходимо да сравните с предишния модел.

Удостоверяване и управление на ключове

Заявките се удостоверяват с помощта на Bearer в заглавката Authorization. Генерирайте ключа си от таблото за управление на DeepSeek и го съхранявайте сигурно, например в променливи на средата или мениджъри на секретни данни като AWS Secrets Manager.

Таблото за управление показва данни за употреба и фактуриране, за да се следи потреблението на токени . Въпреки че цените са намалели, препоръчително е да се въведат ограничения на цените и периодична ротация на ключовете на компютрите, както и да се отменят всички компрометирани ключове незабавно.

Завършвания на чат, шаблони и основни заявки

Централната крайна точка е /chat/completions , която обработва многократни диалози и поддържа контекст между повикванията, идеален сценарий за силните страни на V3.2-Exp, свързани с дългия контекст. Има два типични режима на модела: deepseek-chat и deepseek-reasoner.

Едно просто тяло на заявката може да изглежда така, използвайки JSON с екранирани кавички (представени тук като „за по-голяма яснота“): то включва системен подкаст и потребителски подкаст.

{ "model": "deepseek-chat", "messages": [ { "role": "system", "content": "Вие сте технически експерт." }, { "role": "user", "content": "Обяснете рядкото внимание." } ], "stream": false }

Когато искате отговори в реално време, активирайте `stream=true` . Заглавките трябва да включват `Content-Type: application/json` и токена в `Authorization: Bearer ${DEEPSEEK_API_KEY}`. Ако работите с изрично разсъждение, можете да контролирате поведението с флага `reasoning.enabled`.

Структура на отговора и SSE стрийминг

Нестрийминг отговорите включват полета като id , object, created, model, choices и usage. В choices ще намерите генерираното съдържание (роля: „асистент“), а в usage - подробностите за prompt_tokens , completion_tokens и total_tokens.

В стрийминг режим, API изпраща Server-Sent Events (Събития, изпратени от сървъра) . Всеки фрагмент пристига като събитие с данни с делта стойност, която трябва да се натрупа. Това е идеалният вариант за интерактивни интерфейси или терминали с инкрементален изход.

Извикване на функции и изход в стриктен JSON

Можете да дефинирате инструменти , така че моделът да решава кога да извика функция, например за извличане на данни или изпълнение на действия. Това се вписва добре в потоците на агентите и интеграциите с backend.

Ако имате нужда от структуриран изход, принудете JSON режим, използвайки `response_format`. Това е полезно за извличане на данни или автоматична валидация в конвейери.

Примери на Python с SDK в стил OpenAI

С Python, кривата на обучение е много гладка. Конфигурирайте базовия API , за да съответства на този на DeepSeek, дефинирайте ключа и изпращайте заявки; можете да превключвате между стандартен режим и стрийминг в зависимост от случая на употреба.

import openai openai.api_base = "https://api.deepseek.com" openai.api_key = "your_api_key_here" response = openai.ChatCompletion.create( model="deepseek-chat", messages=[ {"role": "system", "content": "Вие сте асистент по кодиране."}, {"role": "user", "content": "Напишете Python функция за изчисляване на числата на Фибоначи."} ], stream=False ) print(response.choices[0].message.content) # Поточно предаване stream = openai.ChatCompletion.create(model="deepseek-chat", messages=[...], stream=True) for chunk in stream: if chunk.choices[0].delta.content is not None: print(chunk.choices[0].delta.content, end="") # Извикване на функция (дефиниция на инструмент) tools = [ { "type": "function", "function": { "name": "get_weather", "description": "Получаване на текущо време", "parameters": { "type": "object", "properties": { "location": {"type": "string"} }, "required": [ "location" ] } } } ]

За стриктен JSON изход, задайте response_format на {"type": "json_object"}. И ако ще имате дълги диалози, не забравяйте да ограничите контекста , за да останете в рамките на ограниченията и да увеличите максимално ефективността.

Интеграция с Apidog

Apidog ускорява прототипирането на повиквания : той импортира спецификации, запазва променливи на средата (като ключа), изгражда POST заявки и тества в движение. Неговият симулатор на отговори улеснява тестването на гранични случаи без използване на токени.

Той също така генерира фрагменти от код на различни езици и предлага изглед на времева линия за отстраняване на грешки при удостоверяване или параметри. Тъй като V3.2-Exp обработва големи контексти, Apidog е идеален за експериментиране с дълги подкани и тестване на производителността.

Добри практики за извличане на максимална полза

Дефинирайте ясни и кратки системни подкани , които очертават поведението. За сложни проблеми, методът на разсъждение може да бъде полезен, комбинирайки го с техники за структуриране на мисленето, подходящи за вашата ситуация.

Управлявайте контекста разумно: въпреки че V3.2-Exp толерира дълъг контекст (цитират се случаи до 128K), прекомерната история може да повлияе негативно на ефективността. Внедрете интелигентно отрязване, кеширане за чести заявки и пакетна обработка, където е уместно.

От съображения за сигурност, дезинфекцирайте входните данни, за да предотвратите инжектиране на бързи данни и да регистрирате взаимодействията в лог файловете за одит . Регулирайте температурата (temperature) и top_p според целта си: ниски стойности за детерминизъм, високи стойности за креативност.

Проведете A/B тестове между deepseek-chat и deepseek-reasoner , за да изберете оптималния режим. И не забравяйте ограничението на скоростта, за да избегнете изненади при фактурирането.

Сравнение с V3.1-Terminus

Въвеждането на DSA води до подобрения в латентността , които в някои сценарии достигат 3 пъти по-висока скорост, без да се жертва общото качество. Това е еволюция, фокусирана върху съотношението мощност-ефективност, а не върху рекордната точност.

Малките увеличения в кодирането и леките намаления в хуманитарните области отразяват фината настройка, присъща на модел, който по замисъл е експериментален . Времевата крайна точка V3.1 позволява директни сравнения, които показват подобрения в DSA за дълъг период.

Разширено локално внедряване

За внедрявания, чувствителни към поверителност или офлайн, изтеглянето на теглата от Hugging Face и използването на официалните скриптове за преобразуване е правилният начин. Конфигурирайте броя на експертите (например 256) и коригирайте паралелизма на модела, за да съответства на вашите графични процесори.

Демонстрацията за инференциални изводи позволява интерактивно тестване, а ядрата TileLang или CUDA ще ви помогнат да увеличите максимално производителността според приоритетите: скорост на прототипиране или максимална производителност в продукцията.

Отворени ядра и производителност

TileLang дава приоритет на четимостта и дизайна при изследване, така че можете бързо да внедрявате нови идеи. Той е идеален, ако изследвате вариации на разсеяно внимание или оптимизации на паметта.

За да се извлече максимума от всяка милисекунда, CUDA ядрата влизат в действие: logit индексите (с версии на страници) се намират в DeepGEMM , докато индексите за разредено внимание се намират във FlashMLA . Тази сегментация позволява на всеки екип да избере оптималния стек , без да извършва повторна работа.

Лиценз, среща и контакт за DeepSeek-V3.2-Exp

Теглата на хранилището и модела са публикувани под лиценза на MIT. Това отваря вратата за изключително гъвкава търговска употреба, насърчавайки приемането и иновациите в екосистемата.

За да се използва V3.2-Exp в публикации, DeepSeek предоставя цитиране @misc със заглавие „DeepSeek-V3.2-Exp: Повишаване на ефективността в дългия контекст с DeepSeek Sparse Attention“ и авторство „DeepSeek-AI“ (година 2025). За въпроси или проблеми, моля, свържете се с [email protected ]

Официални ресурси и полезни връзки за DeepSeek-V3.2-Exp

Ако искате да изтеглите модела, можете да го намерите на Hugging Face . Техническият доклад е достъпен в GitHub, заедно с подробности за внедряването и оценки.

За сравнителни тестове между V3.2-Exp и V3.1-Terminus, моля, вижте официалното ръководство . А ако искате да изпратите предложения, има публичен канал за обратна връзка на адрес https://feedback.deepseek.com/dsa.

С V3.2-Exp, DeepSeek дава приоритет на една проста идея: ефективност без компромис с качеството . DSA задава курса за модели, които поддържат масивни контексти на разумна цена, опростеният API предоставя тези възможности на повече екипи, а отвореният стек (тегла, ядра и документация) улеснява общността да проучва, сравнява и изгражда продукти от реалния свят безпроблемно.


Добавяне като предпочитан източник в Google