Table of Contents

ਉਤਪਾਦ ਦੇ ਲੇਬਲ ਉੱਤੇ 32GB ਹੋਣਾ Qwen 27B ਵਰਕਲੋਡ ਲਈ 32GB ਉਪਲਬਧ ਹੋਣ ਦਾ ਮਤਲਬ ਨਹੀਂ। ਓਪਰੇਟਿੰਗ ਸਿਸਟਮ, ਰਨਟਾਈਮ, KV ਕੈਸ਼, ਮਾਡਲ ਫਾਰਮੈਟ, ਡਰਾਈਵਰ ਸਟੈਕ ਅਤੇ ਕਾਰਡਾਂ ਦੀ ਬਣਤਰ ਨਤੀਜਾ ਬਦਲਦੇ ਹਨ। ਕਾਫ਼ੀ ਸਮਰੱਥਾ ਵਾਲਾ ਸਸਤਾ ਕਾਰਡ ਵੀ ਪ੍ਰਾਂਪਟ ਪ੍ਰੋਸੈਸਿੰਗ ਜਾਂ ਸੈਟਅਪ ਸਮੇਂ ਵਿੱਚ ਬੁਰੀ ਤਰ੍ਹਾਂ ਪਿੱਛੇ ਰਹਿ ਸਕਦਾ ਹੈ।

ਅਕਤੂਬਰ 2026 ਵਿੱਚ VRAM ਦੀ ਗਿਣਤੀ ਇਕੱਲੀ ਨਾ ਦੇਖੋ। ਵਰਤਣਯੋਗ ਮੈਮੋਰੀ ਅਤੇ ਪ੍ਰਤੀ ਡਾਲਰ ਪੂਰਾ ਹੋਇਆ ਕੰਮ ਦੇਖੋ।

ਇਹ ਗਾਈਡ ਵੱਡੀ ਕਾਂਟੈਕਸਟ ਵਿੰਡੋ ਨਾਲ 6-ਬਿਟ ਗੁਣਵੱਤਾ ਵਾਲਾ Qwen 27B ਮਾਡਲ ਚਲਾਉਣ ਦੇ ਕਾਰਗਰ ਤਰੀਕੇ ਵੇਖਦੀ ਹੈ। ਇਹ ਪ੍ਰਕਾਸ਼ਿਤ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ ਨੂੰ ਰਿਪੋਰਟ ਕੀਤੇ ਟੈਸਟ ਨਤੀਜਿਆਂ ਤੋਂ ਵੱਖ ਕਰਦੀ ਹੈ, ਕਿਉਂਕਿ ਕਿਸੇ ਇੱਕ ਵਿਅਕਤੀ ਦਾ tokens-per-second ਨਤੀਜਾ GPU ਦੀ ਸਾਰਵਭੌਮ ਵਿਸ਼ੇਸ਼ਤਾ ਨਹੀਂ ਹੁੰਦਾ।

32GB ਨੂੰ ਟੀਚਾ ਕਿਉਂ ਬਣਾਇਆ ਜਾਂਦਾ ਹੈ

ਮੈਮੋਰੀ ਦੀ ਲੋੜ ਵਜ਼ਨਾਂ ਤੋਂ ਸ਼ੁਰੂ ਹੁੰਦੀ ਹੈ। ਇੱਕ dense 27B ਮਾਡਲ ਜਨਰੇਸ਼ਨ ਦੌਰਾਨ ਪੂਰਾ parameter set ਪੜ੍ਹਦਾ ਹੈ। 6-ਬਿਟ quantization ਵਿੱਚ runtime allocation ਅਤੇ ਕਾਂਟੈਕਸਟ ਮੈਮੋਰੀ ਜੋੜਨ ਤੋਂ ਪਹਿਲਾਂ ਵਜ਼ਨ ਲਗਭਗ 20.5GB ਲੈਂਦੇ ਹਨ।

128K-token ਕਾਂਟੈਕਸਟ ਹੋਰ ਵੱਡੀ allocation ਜੋੜਦਾ ਹੈ। ਸਹੀ KV-cache ਆਕਾਰ ਮਾਡਲ architecture, cache precision, batch settings ਅਤੇ backend ਨਾਲ ਬਦਲਦਾ ਹੈ। ਲਗਭਗ 8GB ਦਾ ਕਾਰਗਰ ਅੰਦਾਜ਼ਾ ਵਜ਼ਨਾਂ ਅਤੇ ਕੈਸ਼ ਨੂੰ ਮਿਲਾ ਕੇ 28.5GB ਦੇ ਨੇੜੇ ਲਿਆਉਂਦਾ ਹੈ। ਇਸ ਤੋਂ ਪਹਿਲਾਂ ਓਪਰੇਟਿੰਗ ਸਿਸਟਮ ਅਤੇ inference runtime ਆਪਣਾ ਹਿੱਸਾ ਲੈਂਦੇ ਹਨ।

ਸੰਰਚਨਾਕੀ ਸਹਾਇਕ ਹੈ
24GB discrete GPUਘੱਟ ਕਾਂਟੈਕਸਟ ਨਾਲ 4-ਬਿਟ ਵਜ਼ਨ, ਜਾਂ ਅੰਸ਼ਕ offload
32GB discrete GPUਵਰਤਣਯੋਗ 128K ਕਾਂਟੈਕਸਟ ਟੀਚੇ ਨਾਲ 6-ਬਿਟ ਵਜ਼ਨ
ਦੋ 16GB GPUruntime overhead ਲਈ ਘੱਟ headroom ਵਾਲਾ split model
64GB unified memoryਵੱਡਾ ਕਾਂਟੈਕਸਟ ਅਤੇ ਮਾਡਲ, GPU memory allocation limit ਦੇ ਅਧੀਨ

32GB sizing point ਹੈ, ਗਾਰੰਟੀ ਨਹੀਂ। ਮਾਡਲ load ਹੋ ਸਕਦਾ ਹੈ, ਪਰ ਲੰਮੇ prompt, ਵੱਡੇ batch, multimodal input ਜਾਂ ਦੂਜੇ process ਲਈ ਥਾਂ ਘੱਟ ਰਹਿ ਸਕਦੀ ਹੈ।

ਵੀਡੀਓ ਇੱਕ ਲਾਭਦਾਇਕ ਮੈਦਾਨੀ ਹਵਾਲਾ ਹੈ

ਹੇਠਾਂ ਦਿੱਤੀ ਵੀਡੀਓ local AI ਲਈ 32GB ਤੱਕ ਪਹੁੰਚਣ ਦੇ ਮੁੱਖ ਤਰੀਕਿਆਂ ਦੀ hands-on ਤੁਲਨਾ ਦਿੰਦੀ ਹੈ। ਇਹ ਰਿਪੋਰਟ ਕੀਤੀਆਂ ਕੀਮਤਾਂ, setup friction ਅਤੇ runtime ਨਤੀਜਿਆਂ ਲਈ ਮੈਦਾਨੀ ਹਵਾਲੇ ਵਜੋਂ ਲਾਭਦਾਇਕ ਹੈ। ਇਹ ਲੇਖ hardware specifications, model memory behavior, software support ਅਤੇ total ownership cost ਰਾਹੀਂ ਵੱਖਰੀ ਤੁਲਨਾ ਕਰਦਾ ਹੈ।

ਵਰਤਣਯੋਗ ਮੈਮੋਰੀ ਬਾਕਸ ਦੀ ਮੈਮੋਰੀ ਤੋਂ ਵੱਧ ਮਹੱਤਵਪੂਰਨ ਹੈ

Apple Unified Memory

Apple silicon CPU ਅਤੇ GPU ਲਈ ਸਾਂਝਾ pool ਵਰਤਦਾ ਹੈ। Apple 32GB unified-memory Mac mini configurations ਦੱਸਦਾ ਹੈ, ਪਰ ਪੂਰਾ pool dedicated graphics allocation ਨਹੀਂ ਹੁੰਦਾ। macOS, application ਅਤੇ inference runtime ਨੂੰ ਵੀ ਥਾਂ ਚਾਹੀਦੀ ਹੈ।

ਕੁਝ llama.cpp sessions 32GB system ਉੱਤੇ ਲਗਭਗ 22,906MB available ਦੱਸਦੇ ਹਨ। ਇਹ ਤਕਰੀਬਨ 21.3GiB ਹੈ। ਇਸ ਨਾਲ 6-ਬਿਟ 27B ਮਾਡਲ ਅਤੇ ਵੱਡੇ KV cache ਲਈ ਥੋੜ੍ਹੀ ਥਾਂ ਬਚਦੀ ਹੈ। ਸਹੀ ਸੀਮਾ operating system, model runner, memory pressure ਅਤੇ launch settings ਉੱਤੇ ਨਿਰਭਰ ਕਰਦੀ ਹੈ।

Apple silicon ਸ਼ਾਂਤ systems ਲਈ ਹਾਲੇ ਵੀ ਆਕਰਸ਼ਕ ਹੈ। llama.cpp Metal ਨੂੰ first-class backend ਮੰਨਦਾ ਹੈ ਅਤੇ Apple ਕਈ ਵਰਤੇ data-center cards ਵਾਲੀਆਂ driver ਅਤੇ power ਸਮੱਸਿਆਵਾਂ ਤੋਂ ਬਚਦਾ ਹੈ। ਬਦਲੇ ਵਿੱਚ high-end discrete GPU ਨਾਲੋਂ throughput ਘੱਟ ਅਤੇ memory headroom ਘੱਟ ਅਨੁਮਾਨਯੋਗ ਹੁੰਦਾ ਹੈ।

ਦੋ 16GB ਕਾਰਡ

ਦੋ 16GB cards 32GB physical VRAM ਦਿੰਦੇ ਹਨ, ਪਰ model runtime ਨੂੰ per-device buffers ਅਤੇ communication space ਵੀ ਚਾਹੀਦੀ ਹੈ। ਇੱਕ ਕਾਰਡ 13.4GB ਵਰਤੋਂ ਦੱਸ ਸਕਦਾ ਹੈ ਅਤੇ ਦੂਜਾ 14.4GB। ਬਚੀ capacity context ਲਈ ਸਾਫ਼ 4GB reserve ਨਹੀਂ ਹੁੰਦੀ।

Split method ਵੀ ਮਹੱਤਵਪੂਰਨ ਹੈ। Layer splitting ਵੱਖ-ਵੱਖ model layers ਨੂੰ ਵੱਖਰੇ cards ਉੱਤੇ ਰੱਖਦਾ ਹੈ। Capacity ਵਧਦੀ ਹੈ, ਪਰ cards model ਰਾਹੀਂ ਵਾਰੀ-ਵਾਰੀ ਕੰਮ ਕਰਦੇ ਹਨ। Tensor splitting ਇੱਕੋ layer ਦਾ ਕੰਮ ਦੋਵਾਂ cards ਉੱਤੇ ਰੱਖਦਾ ਹੈ। Communication ਵਧਦੀ ਹੈ, ਪਰ ਦੋਵੇਂ devices ਸਿੱਧਾ ਵੱਧ ਯੋਗਦਾਨ ਦਿੰਦੇ ਹਨ।

Split methodਮੁੱਖ ਲਾਭਮੁੱਖ ਲਾਗਤ
Layer splitCapacity ਦਾ ਸੌਖਾ ਵਿਸਥਾਰਇੱਕ card ਅਕਸਰ ਦੂਜੇ ਦੇ ਕੰਮ ਦੌਰਾਨ ਉਡੀਕਦਾ ਹੈ
Tensor splitਕੁਝ workloads ਵਿੱਚ ਵਧੀਆ parallel computeਵੱਧ tuning ਅਤੇ interconnect traffic
CPU plus GPU offloadਕੁੱਲ VRAM ਤੋਂ ਵੱਡੇ models fit ਕਰਦਾ ਹੈCPU ਵੱਲੋਂ layers ਵਾਰ-ਵਾਰ ਸੰਭਾਲਣ ਉੱਤੇ ਵੱਡੀ speed penalty

ਦੋ-card ਯੋਜਨਾ ਲਈ ਖਰੀਦ ਤੋਂ ਪਹਿਲਾਂ tested backend ਲੋੜੀਂਦਾ ਹੈ। PCIe generation, slot spacing, power delivery, driver support ਅਤੇ exact quantization ਸਾਰੇ ਨਤੀਜੇ ਬਦਲਦੇ ਹਨ।

Single-Card ਵਿਕਲਪ

RTX 5090

NVIDIA RTX 5090 ਲਈ 32GB GDDR7 ਅਤੇ 1,792GB/s memory bandwidth ਦੱਸਦਾ ਹੈ। ਇਸ ਵਿੱਚ broad CUDA support, mature tooling ਅਤੇ ਕਈ tested front ends ਹਨ। ਮੌਜੂਦਾ CUDA GPU table RTX 5090 ਨੂੰ compute capability 12.0 ਉੱਤੇ ਦਰਜ ਕਰਦੀ ਹੈ।

ਸਮੱਸਿਆ ਕੀਮਤ ਹੈ। ਨਵਾਂ 5090 32GB ਤੱਕ ਸਾਫ਼ ਰਸਤਾ ਦਿੰਦਾ ਹੈ, ਪਰ ਖਰੀਦ ਲਾਗਤ rented accelerator time ਦੇ ਕਈ ਮਹੀਨਿਆਂ ਨਾਲ ਮੁਕਾਬਲਾ ਕਰਦੀ ਹੈ। ਇਹ 575W total graphics power ਤੱਕ ਵੀ ਲੈਂਦਾ ਹੈ। ਇਸ ਲਈ system ਨੂੰ serious power supply ਅਤੇ cooling plan ਚਾਹੀਦਾ ਹੈ।

Radeon AI PRO R9700

R9700 high memory bandwidth ਵਾਲਾ 32GB-class AMD ਵਿਕਲਪ ਹੈ ਅਤੇ ਕਈ listings ਵਿੱਚ 5090 ਨਾਲੋਂ ਘੱਟ entry price ਰੱਖਦਾ ਹੈ। ਇਸ ਦੀ value runtime ਉੱਤੇ ਬਹੁਤ ਨਿਰਭਰ ਕਰਦੀ ਹੈ। Default llama.cpp path ਵਰਤਣਯੋਗ ਨਤੀਜਾ ਦਿੰਦਾ ਹੈ। Faster community backend ਕੁਝ reported tests ਵਿੱਚ ਉਸੇ card ਉੱਤੇ ਕਾਫ਼ੀ ਵੱਧ ਨਤੀਜਾ ਦਿੰਦਾ ਹੈ।

ਇਹ ਸਾਫ਼ ਦਿਖਾਉਂਦਾ ਹੈ ਕਿ GPU comparison ਵਿੱਚ ਦੋ speed columns ਕਿਉਂ ਚਾਹੀਦੇ ਹਨ। Decode speed generated tokens ਮਾਪਦੀ ਹੈ। Prefill speed ਮਾਪਦੀ ਹੈ ਕਿ backend ਪਹਿਲੇ generated token ਤੋਂ ਪਹਿਲਾਂ prompt ਕਿੰਨੀ ਤੇਜ਼ੀ ਨਾਲ ਪੜ੍ਹਦਾ ਹੈ। 50,000-token codebase weak prefill path ਦਿਖਾਉਂਦੀ ਹੈ, ਭਾਵੇਂ decode speed ਠੀਕ ਲੱਗੇ।

Intel Arc Pro B70

Arc Pro B70 professional workloads ਲਈ 32GB memory ਨੂੰ ਨਿਸ਼ਾਨਾ ਬਣਾਉਂਦਾ ਹੈ। ਇਹ capacity-per-dollar ਵਿਕਲਪ ਹੈ, ਪਰ software path ਨੂੰ CUDA hardware ਨਾਲੋਂ ਵੱਧ ਜਾਂਚ ਚਾਹੀਦੀ ਹੈ। Standard GGUF support, patched builds, draft-token settings ਅਤੇ backend maturity ਸਾਰੇ ਨਤੀਜੇ ਬਦਲਦੇ ਹਨ।

ਘੱਟ purchase price working build ਲੱਭਣ ਵਿੱਚ ਲੱਗੇ ਘੰਟਿਆਂ ਦੀ ਭਰਪਾਈ ਨਹੀਂ ਕਰਦੀ। Tinkerer ਲਈ ਇਹ ਕੰਮ project ਦਾ ਹਿੱਸਾ ਹੈ। ਹਰ ਰੋਜ਼ ਵਰਤੇ ਜਾਣ ਵਾਲੇ workstation ਲਈ driver ਅਤੇ application support ਦੀ ਅਸਲ ਕੀਮਤ ਹੈ।

ਵਰਤੇ Data-Center Cards

Tesla V100

ਵਰਤੇ 32GB Tesla V100 cards ਧਿਆਨ ਖਿੱਚਦੇ ਹਨ ਕਿਉਂਕਿ card price ਘੱਟ ਦਿਖਾਈ ਦਿੰਦੀ ਹੈ। Full build ਵੱਧ ਮਹਿੰਗੀ ਹੁੰਦੀ ਹੈ। Passive data-center card ਨੂੰ airflow, ਢੁਕਵਾਂ chassis ਜਾਂ shroud, power adapters ਅਤੇ ਕਾਫ਼ੀ PCIe space ਵਾਲਾ host ਚਾਹੀਦਾ ਹੈ।

ਦੂਜੀ ਸਮੱਸਿਆ software age ਹੈ। ਮੌਜੂਦਾ CUDA GPU table ਨਵੇਂ architectures ਉੱਤੇ ਕੇਂਦਰਿਤ ਹੈ ਅਤੇ ਆਪਣੀ current architecture table ਵਿੱਚ V100 ਨਹੀਂ ਦਿਖਾਉਂਦੀ। ਖਰੀਦ ਤੋਂ ਪਹਿਲਾਂ exact CUDA release, driver branch, backend ਅਤੇ community fork ਜਾਂਚੋ।

Bare card ਨਹੀਂ, working V100 system ਦਾ budget ਬਣਾਓ। $680 ਦੇ ਨੇੜੇ ਦਰਜ card cooling, adapters ਅਤੇ host platform ਤੋਂ ਬਾਅਦ ਲਗਭਗ $1,000 project ਬਣ ਸਕਦਾ ਹੈ। Popular local-AI workload ਨਾਲ retired accelerator ਦੀ ਮੰਗ ਵਧੇ ਤਾਂ used prices ਵੀ ਵਧਦੀਆਂ ਹਨ।

AMD Instinct MI50

MI50 ਪ੍ਰਤੀ gigabyte ਆਕਰਸ਼ਕ used price ਦਿੰਦਾ ਹੈ, ਪਰ current software support ਗੰਭੀਰ ਰੁਕਾਵਟ ਹੈ। Older ROCm stack ਜਾਂ community-maintained fork ਦੀ ਲੋੜ ਵਾਲਾ card mainstream application support ਵਾਲੇ current consumer card ਦੇ ਬਰਾਬਰ ਨਹੀਂ ਹੁੰਦਾ।

Reported prompt-processing gap sticker price ਨਾਲੋਂ ਵੱਧ ਮਹੱਤਵ ਰੱਖਦਾ ਹੈ। ਇੱਕ comparison ਨੇ prompt-processing workload ਵਿੱਚ MI50 ਉੱਤੇ ਲਗਭਗ 128 tokens per second ਅਤੇ ਨਵੇਂ 32GB card ਉੱਤੇ ਲਗਭਗ 2,652 tokens per second ਮਾਪੇ। 50,000-token codebase generation ਸ਼ੁਰੂ ਹੋਣ ਤੋਂ ਪਹਿਲਾਂ slower path ਉੱਤੇ ਮਿੰਟ ਅਤੇ faster path ਉੱਤੇ seconds ਲਵੇਗੀ।

MI50 ਇੱਕ narrow use case ਲਈ ਹੈ। ਇਹ ਉਸ builder ਲਈ ਢੁਕਵਾਂ ਹੈ ਜੋ interaction speed ਨਾਲੋਂ capacity ਨੂੰ ਤਰਜੀਹ ਦਿੰਦਾ ਹੈ ਅਤੇ driver maintenance ਸਵੀਕਾਰ ਕਰਦਾ ਹੈ। Prefill time ਮਹੱਤਵਪੂਰਨ ਹੋਣ ਉੱਤੇ rapid codebase analysis ਲਈ ਇਹ ਮਾੜੀ ਚੋਣ ਹੈ।

Software ਵੀ GPU ਦਾ ਹਿੱਸਾ ਹੈ

llama.cpp CUDA, HIP, Metal, Vulkan, SYCL ਅਤੇ ਹੋਰ backends ਨੂੰ support ਕਰਦਾ ਹੈ। ਇਹ CPU plus GPU hybrid inference ਅਤੇ multi-GPU use ਵੀ support ਕਰਦਾ ਹੈ। ਇਹ features ਵੱਖਰੇ vendors ਜਾਂ model formats ਉੱਤੇ ਇੱਕੋ performance ਨਹੀਂ ਦਿੰਦੇ।

ਇੱਕੋ physical card ਅਕਸਰ ਇਨ੍ਹਾਂ ਵਿੱਚ ਵੱਡੇ ਫਰਕ ਦਿਖਾਉਂਦਾ ਹੈ:

  • Default application build conservative settings ਨਾਲ।
  • Tuned llama.cpp build backend-specific kernels ਨਾਲ।
  • Community fork speculative ਜਾਂ multi-token prediction ਨਾਲ।
  • Patched model format ਇੱਕ accelerator path ਲਈ ਬਣਿਆ ਹੋਇਆ।

Supplied comparison ਵਿੱਚ reported results ਵਿੱਚ default 32GB AMD path ਲਈ ਲਗਭਗ 27 tokens per second, multi-token prediction ਨਾਲ ਲਗਭਗ 46 tokens per second, ਅਤੇ specialized backend ਉੱਤੇ ਕਾਫ਼ੀ ਵੱਧ results ਸ਼ਾਮਲ ਹਨ। ਇਹ result software headroom ਦਾ evidence ਹੈ। Fresh installation ਲਈ ਇਹ promise ਨਹੀਂ ਹੈ।

ਹਰ benchmark ਨਾਲ backend, commit, model file, quantization, context length, prompt length, batch size ਅਤੇ power state ਲਿਖੋ। ਇਨ੍ਹਾਂ fields ਤੋਂ ਬਿਨਾਂ tokens per second advertisement number ਹੈ।

ਖਰੀਦਣ ਦੀ ਬਜਾਏ ਕਿਰਾਏ ਉੱਤੇ ਲੈਣਾ

Fast GPU ਕਿਰਾਏ ਉੱਤੇ ਲੈਣਾ calculation ਬਦਲਦਾ ਹੈ। ਲਗਭਗ $0.69 ਪ੍ਰਤੀ ਘੰਟਾ RTX 5090 rental price ਨਾਲ $4,400 purchase ਬਿਜਲੀ, host hardware, maintenance ਅਤੇ resale value ਜੋੜਨ ਤੋਂ ਪਹਿਲਾਂ ਤਕਰੀਬਨ 6,377 rental hours ਦੇ ਬਰਾਬਰ ਹੁੰਦੀ ਹੈ।

ਇਹ ਲਗਾਤਾਰ rental ਦੇ ਲਗਭਗ ਨੌਂ ਮਹੀਨੇ ਜਾਂ ਰੋਜ਼ ਅੱਠ ਘੰਟਿਆਂ ਦੇ ਦੋ ਸਾਲ ਦੇ ਨੇੜੇ ਹੈ। $1,560 ਦੇ ਨੇੜੇ two-card desktop ਉਸੇ rental rate ਉੱਤੇ ਲਗਭਗ 2,261 hours ਦੇ ਬਰਾਬਰ ਹੈ। Rented 5090 local heat, noise, driver setup ਅਤੇ card failure ਤੋਂ ਵੀ ਬਚਾਉਂਦਾ ਹੈ।

ਵਰਤੋਂ ਦਾ ਢੰਗਪਹਿਲਾ ਵਧੀਆ ਟੈਸਟ
ਹਫ਼ਤੇ ਵਿੱਚ ਕੁਝ ਘੰਟੇHosted model ਜਾਂ rented GPU
ਛੋਟਾ project5090-class card rent ਕਰਕੇ ਅਸਲ workload ਮਾਪੋ
ਰੋਜ਼ਾਨਾ interactive useBackend ਅਤੇ context target test ਕਰਨ ਤੋਂ ਬਾਅਦ ਹੀ ਖਰੀਦੋ
ਰਾਤ ਭਰ ਚੱਲਣ ਵਾਲੇ agentsOwned hardware ਨੂੰ justify ਕਰਨਾ ਸੌਖਾ ਹੁੰਦਾ ਹੈ
ਨਿੱਜੀ data ਅਤੇ steady loadNetwork isolation ਵਾਲਾ owned hardware

Model, backend ਜਾਂ context length ਅਣਿਸ਼ਚਿਤ ਹੋਵੇ ਤਾਂ ਖਰੀਦ ਤੋਂ ਪਹਿਲਾਂ rent ਕਰੋ। ਇੱਕ weekend ਦਾ measured use ਗਲਤ workstation purchase ਨਾਲੋਂ ਸਸਤਾ ਹੈ।

ਖਰੀਦ ਸਿਫ਼ਾਰਸ਼ਾਂ

ਦੋ RTX 5060 Ti 16GB Cards

ਦੋ 16GB cards ਉਹਨਾਂ buyers ਲਈ practical CUDA path ਦਿੰਦੇ ਹਨ ਜਿਨ੍ਹਾਂ ਨੂੰ 32GB ਅਤੇ common tutorials, drivers ਅਤੇ front ends ਚਾਹੀਦੇ ਹਨ। Model format ਅਤੇ backend ਦੀ ਪੁਸ਼ਟੀ ਤੋਂ ਬਾਅਦ ਹੀ tensor splitting ਵਰਤੋ। Layer splitting ਸੌਖੀ ਹੈ, ਪਰ performance ਦਾ ਕੁਝ ਹਿੱਸਾ ਛੱਡ ਦਿੰਦੀ ਹੈ।

ਇਸ route ਨੂੰ ਦੋ usable slots ਵਾਲਾ motherboard, ਕਾਫ਼ੀ power ਅਤੇ cards ਵਿਚਕਾਰ airflow ਵੀ ਚਾਹੀਦਾ ਹੈ। Platform cost ਸਮੇਤ pair of cards ਛੋਟਾ workstation build ਨਹੀਂ ਰਹਿੰਦਾ।

ਇੱਕ 32GB Card

ਇੱਕ 32GB card ਚੁਣੋ ਜਦੋਂ reliability, warranty coverage ਅਤੇ simple deployment ਸਭ ਤੋਂ ਘੱਟ memory price ਨਾਲੋਂ ਵੱਧ ਮਹੱਤਵ ਰੱਖਦੇ ਹਨ। R9700 ਅਤੇ RTX 5090 ਇਸ ਚੋਣ ਦੇ ਵੱਖਰੇ ਰੂਪ ਹਨ। AMD path capacity ਅਤੇ price ਨੂੰ ਤਰਜੀਹ ਦਿੰਦਾ ਹੈ। NVIDIA path software breadth ਅਤੇ mature CUDA support ਨੂੰ ਤਰਜੀਹ ਦਿੰਦਾ ਹੈ।

ਵਰਤਿਆ V100 ਜਾਂ MI50

Used data-center hardware ਤਦ ਹੀ ਚੁਣੋ ਜਦੋਂ project ਵਿੱਚ driver testing, cooling work ਅਤੇ backend maintenance ਵੀ ਸ਼ਾਮਲ ਹੋਵੇ। Card price budget ਦੀ ਪਹਿਲੀ line ਹੈ, ਆਖ਼ਰੀ ਨਹੀਂ।

Apple Silicon

32GB Apple silicon system ਤਦ ਚੁਣੋ ਜਦੋਂ silence, low idle power ਅਤੇ compact desktop maximum throughput ਨਾਲੋਂ ਵੱਧ ਮਹੱਤਵ ਰੱਖਦੇ ਹੋਣ। Exact runner ਦੁਆਰਾ ਦੱਸੀ memory allocation ਜਾਂਚੋ। Full 32GB model ਲਈ ਉਪਲਬਧ ਮੰਨੋ ਨਾ।

Cloud Rental

Rental ਤਦ ਚੁਣੋ ਜਦੋਂ workload ਕਦੇ-ਕਦੇ ਹੁੰਦਾ ਹੈ, model ਬਦਲਦਾ ਰਹਿੰਦਾ ਹੈ ਜਾਂ fast prompt response local ownership ਨਾਲੋਂ ਵੱਧ ਮਹੱਤਵ ਰੱਖਦਾ ਹੈ। Test ਤੋਂ ਬਾਅਦ instance ਬੰਦ ਕਰੋ। Idle time price advantage ਨੂੰ ਜਲਦੀ ਖਤਮ ਕਰਦਾ ਹੈ।

ਬਿਹਤਰ Comparison Worksheet

ਖਰੀਦ ਤੋਂ ਪਹਿਲਾਂ ਹਰ candidate ਲਈ ਇਹ values ਲਿਖੋ:

  • Usable model memory, runtime overhead ਤੋਂ ਬਾਅਦ।
  • Weight format ਅਤੇ expected model size।
  • KV-cache size target context length ਉੱਤੇ।
  • Prefill speed, representative prompt ਲਈ।
  • Decode speed, context full ਹੋਣ ਤੋਂ ਬਾਅਦ।
  • Backend ਅਤੇ driver version, result ਲਈ ਲੋੜੀਂਦੇ।
  • Idle ਅਤੇ loaded power, ਤੁਹਾਡੇ local electricity rate ਉੱਤੇ।
  • Host cost, cooling, adapters, storage ਅਤੇ warranty ਸਮੇਤ।
  • Rental equivalent, expected use hours ਲਈ।

ਸਭ ਤੋਂ ਲਾਭਦਾਇਕ test ਤੁਹਾਡੇ ਅਸਲ workload ਦਾ prompt ਹੈ। Coding ਲਈ representative codebase ਵਰਤੋ। Research ਲਈ normal retrieval ਜਾਂ paste workflow ਵਾਲਾ long document ਵਰਤੋ। Time to first token, prompt processing time, generation speed, memory use ਅਤੇ output quality ਮਾਪੋ।

ਅੰਤਿਮ ਸਿਫ਼ਾਰਸ਼

ਸਭ ਤੋਂ ਘੱਟ friction ਵਾਲੇ 32GB CUDA build ਲਈ ਦੋ RTX 5060 Ti 16GB cards ਖਰੀਦੋ। Backend expected ਤਰੀਕੇ ਨਾਲ ਕੰਮ ਕਰਦਾ ਹੈ, ਇਹ ਛੋਟੇ test ਤੋਂ ਬਾਅਦ ਹੀ tensor-split configuration ਵਰਤੋ।

Cleaner workstation ਚਾਹੀਦਾ ਹੋਵੇ ਤਾਂ ਇੱਕ 32GB card ਖਰੀਦੋ। ਆਪਣੇ chosen runner ਲਈ ਮਜ਼ਬੂਤ software path ਵਾਲਾ card ਚੁਣੋ। ਸਭ ਤੋਂ ਘੱਟ dollars-per-gigabyte ਵਾਲਾ card ਨਾ ਚੁਣੋ।

V100 ਜਾਂ MI50 ਸਿਰਫ਼ maintenance project ਸਵੀਕਾਰ ਕਰਨ ਉੱਤੇ ਵਰਤੋ। Weak prefill performance ਵਾਲਾ cheap accelerator ਲੰਮੇ codebase prompts ਲਈ bargain ਨਹੀਂ ਹੈ।

Use irregular ਹੋਵੇ ਤਾਂ 5090-class GPU rent ਕਰੋ। Rental test ਵੱਡੀ ਖਰੀਦ ਤੋਂ ਪਹਿਲਾਂ real memory, speed ਅਤੇ context data ਦਿੰਦਾ ਹੈ।

32GB ਦਾ ਸਵਾਲ ਇਸ ਲਈ “ਸਭ ਤੋਂ ਸਸਤਾ gigabyte ਕਿਹੜੇ card ਵਿੱਚ ਹੈ?” ਨਹੀਂ ਹੈ। ਸਵਾਲ ਇਹ ਹੈ ਕਿ ਕਿਹੜਾ system ਕਾਫ਼ੀ usable memory ਛੱਡਦਾ ਹੈ, ਮੇਰਾ workload ਤੇਜ਼ੀ ਨਾਲ ਪੜ੍ਹਦਾ ਹੈ, ਮੇਰੇ software ਨਾਲ ਕੰਮ ਕਰਦਾ ਹੈ ਅਤੇ regular use ਰਾਹੀਂ purchase price ਕਮਾਉਂਦਾ ਹੈ।

ਹਵਾਲੇ

ਅਗਲੇ ਕਦਮ

ਖਰੀਦ ਤੋਂ ਪਹਿਲਾਂ representative prompt ਨਾਲ worksheet ਵਰਤੋ। Time to first token, prompt processing, decode speed, memory use, power ਅਤੇ total platform cost ਦੀ ਤੁਲਨਾ ਕਰੋ। ਛੋਟੇ project ਲਈ ਪਹਿਲਾਂ rent ਕਰੋ ਅਤੇ measured result ਨੂੰ purchase decision ਨਾਲ ਸੰਭਾਲੋ।