192GB of VRAM in One PC… The Cheap Way
Summarized by VidSnap AI from Alex Ziskind on YouTube · Aug 11, 2026 · Watch the original

Résumé : GPUs Intel B60/B70 pour l'inférence LLM locale
Introduction
Ce vidéo, produite par un critique technologique spécialisé en matériel IA, examine les alternatives économiques aux GPU Nvidia pour l'exécution locale de grands modèles de langage (LLM). Le sujet central est la comparaison entre les cartes Intel B60/B70 et les solutions Nvidia haut de gamme, notamment via une carte unique Maxsun embarquant deux GPU B60.
Le Problème : la VRAM coûte cher chez Nvidia
- La VRAM est la ressource critique pour exécuter des LLM : plus vous en avez, plus vous pouvez charger de modèles volumineux, de contexte et d'utilisateurs simultanés.
- Nvidia reste la référence logicielle mais à un prix prohibitif : la RTX Pro 4000 coûte 2 500 $ pour seulement 24 Go.
- L'alternative se trouve chez Intel avec la série B : la B60 offre 24 Go pour 650 $, et la B70 propose 32 Go pour environ 1 000 $.
La Solution : cartes Intel et innovation Maxsun
- Deux B60 (48 Go au total) coûtent environ 1 300 $, contre 6 000 $ pour une RTX Pro 5000 avec la même capacité mémoire.
- Maxsun propose une carte unique avec deux B60 sur un seul PCB (format identique à une carte standard), offrant 48 Go sans occuper deux emplacements.
- Cette carte est plus chère que deux B60 achetées séparément (1 750 $), mais résout un problème de densité matérielle.
Résultats de performance : B70 vs. deux B60
- Petits modèles (Qwen 3 4B FP8) : la B70 domine avec 92 tokens/s, surpassant deux B60 en parallélisme tensoriel (~80-85 tokens/s).
- Modèles moyens (Qwen 3.5 27B INT4) : deux B60 battent la B70 (28,3 vs. 26,7 tokens/s). Une seule B60 ne peut pas exécuter ce modèle (fichier de ~30 Go, trop proche de la limite mémoire).
- Modèles MoE (30B INT4) : performance quasi identique entre B70 (45 tokens/s) et B60 (44,5 tokens/s), avec une légère baisse pour deux B60.
- Génération vidéo (LTX2) : la B70 gagne nettement (167 s vs. 225 s) car ce workload est compute-bound et limité à un seul GPU.
L'Écueil : la bifurcation PCIe
- La carte Maxsun est "switchless" : les deux GPU ne communiquent pas directement entre eux et doivent passer par le CPU via le slot PCIe.
- La carte est invisible si la carte mère ne configure pas la bifurcation PCIe (division du slot entre les deux GPU).
- L'activation se fait dans le BIOS, pas depuis le système d'exploitation. Un accès à distance (Ethernet de gestion) a facilité cette opération.
- Caveat important : toutes les cartes mères grand public ne supportent pas la bifurcation.
Conclusion : quelle carte choisir ?
- Cas d'usage léger (chat, petits modèles) : une B70 unique est plus simple, plus rapide et compatible avec toutes les cartes mères.
- Besoins élevés (modèles 27B+, contexte long, utilisateurs multiples) : deux B60 ou une carte Maxsun sont nécessaires.
- Atout de la Maxsun : densité exceptionnelle — quatre cartes fournissent 192 Go de VRAM (contre 96 Go avec quatre B60 standard), soit un coût de 7 000 $ contre 24 000 $ en Nvidia équivalent.
- Désavantages Intel : le logiciel reste en retard sur CUDA, et la bande passante mémoire est inférieure à celle du GDDR7 Nvidia.
Key Takeaway : Intel offre le meilleur rapport VRAM/prix du marché, et la carte Maxsun double la densité sans pénalité de performance mesurable. Bien que moins rapide que Nvidia en vitesse brute, la solution Intel permet des configurations massives (jusqu'à 256 Go imaginables avec un futur dual-B70) pour une fraction du coût. Le choix se résume à un arbitrage entre performance crête (Nvidia) et capacité mémoire abordable (Intel).
Want to summarize your own videos?
Try VidSnap free