Но это не поставил и забыл. P40 — старая дата-центровая карта для инференса, а не современная игровая видеокарта с понятным охлаждением и видеовыходами . Её стоит брать только если сервер действительно может её прокормить, охладить и физически вместить.
Для локальных LLM вопрос часто упирается не в красоту спецификаций, а в простую вещь: помещается ли модель в видеопамять. InsiderLLM отмечает, что 24 ГБ VRAM у Tesla P40 позволяют запускать некоторые 14B-модели целиком на GPU там, где они не помещаются в 12 ГБ у RTX 3060 . Другой гид по б/у видеокартам для локального ИИ формулирует ту же идею: для AI-нагрузок большой объём VRAM у подержанной карты может быть важнее, чем более новая архитектура при меньшей памяти .
При этом возраст скрывать бессмысленно. Vast.ai указывает дату выхода Tesla P40 — 13 сентября 2016 года, объём памяти — 24 ГБ . Accio описывает её как Pascal-карту для дата-центров, изначально рассчитанную на инференс и виртуализацию, которую энтузиасты локального ИИ теперь используют из-за 24 ГБ памяти при низкой цене на вторичном рынке . InsiderLLM прямо называет P40 медленной по современным меркам и в своём сравнении оценивает её примерно в три раза медленнее RTX 3090 .
Низкая цена самой карты легко вводит в заблуждение. Перед покупкой проверьте четыре пункта.
Такую сборку разумнее планировать как сервер для инференса: запускать модели локально, подбирать квантизацию, контекст и параметры сервинга под 24 ГБ VRAM. Accio связывает вторую жизнь P40 именно с локальным запуском LLM и упоминает llama.cpp в контексте домашних и лабораторных сборок на P40 .
Ожидания стоит держать трезвыми. В материале RBA говорится, что P40 не тянет крупнейшие модели переднего края и имеет архитектурные ограничения, но при правильной настройке всё ещё остаётся вполне способной картой .
Если вы ждёте тихую настольную карту, которая уверенно переваривает любую свежую модель, P40 разочарует. InsiderLLM называет её медленной по современным меркам и примерно втрое медленнее RTX 3090 .
Зато понятна причина, по которой такие карты всё ещё покупают. RBA описывает конкретную бюджетную серверную сборку, где б/у P40 запускала Qwen3 Coder 30B примерно на 50 токенах в секунду . Это полезный ориентир, но не универсальный бенчмарк: скорость зависит от модели, настроек, длины контекста, конфигурации сервера и качества охлаждения.
| Вариант | Когда брать | Что по цене и памяти | Главный компромисс |
|---|---|---|---|
| Б/у Tesla P40 24 ГБ | Нужно как можно дешевле получить 24 ГБ VRAM для локального инференса | Источники называют $150–$200, $200–$250, ниже $200 или ниже $300 на вторичном рынке | Старая дата-центровая карта: нет видеовыхода, TDP 250 Вт, нужны питание и грамотное охлаждение |
| Б/у RTX 3090 24 ГБ | Нужны выше скорость и меньше возни с настольной сборкой | Гайд 2026 года указывает примерно $700–$850 за б/у карту | Существенно дороже P40, хотя P40 описывают примерно втрое медленнее |
| A100 40 ГБ или 80 ГБ | Нужна работа с более крупными моделями и есть серьёзный бюджет | A100 бывает в конфигурациях 40 ГБ и 80 ГБ, а б/у A100 80 ГБ оценивают в тысячи долларов |
Если цель — максимум локального инференса за минимум денег, двигайтесь так:
llama.cpp прямо упоминается в материалах о локальном использовании P40 .Для самого дешёвого оживления старого сервера под локальный ИИ б/у Tesla P40 24 ГБ остаётся сильным кандидатом: она даёт много VRAM за деньги, которые недавние гайды часто ставят в диапазон примерно $150–$250 или ниже $300 . Но выигрывает не сама карта, а связка: P40 плюс достаточное питание, направленный обдув и реалистичные ожидания.
Если хочется те же 24 ГБ с меньшим количеством инженерных компромиссов, смотрите в сторону б/у RTX 3090 24 ГБ . Если нужна память уровня A100, это уже не дешёвый апгрейд, а отдельный бюджет в тысячи долларов .
| Обычно ломает идею дешёвого апгрейда старого сервера |