855Fermer857
robinHoodLe 02/09/2026 à 14:58
j'ai bossé un peu avec gemini, ça semble faisable !

faire tourner des monstres de 250 milliards de paramètres dans votre salon sans hypothéquer votre maison. Le concept tient en un format simple : une carte d'extension dédiée (en PCIe ou en USB haut débit) qui accueille des cartouches de modèles interchangeables.

Architecture matérielle de l'accélérateur local (type MoE 250B+)

1. La Carte Hôte (Socle de Calcul et Gestion du Contexte)
La carte hôte centralise la logique de contrôle, l'alimentation et la mémoire volatile de travail :

2. Gamme des Cartouches de Modèles (De la Monocouche Économique au Multicouche 3D)
L'électronique et les matrices de stockage s'inscrivent dans l'emprise physique stricte du socket SP6 (58,5 × 75,4 mm, soit ~4 410 mm²), déclinées en deux philosophies de fabrication sur nœuds matures (14/28 nm) :


---

Analyse Comparative des Architectures d'Inférence

Cette Solution (Host SP6 + Mask-ROM Mono/3D)

GPU Data Center (Nvidia H100/H200)

Carte Graphique Gamer Normale (ex: RTX 5090 à ~2 500 € - 3 000 €)

Apple Silicon (Mac Studio Ultra)

Groq LPU (SRAM Engine)


melbou (./855) :
Si les poids sont stockés en ROM, il faut beaucoup de RAM pour l'inférence?

la ram du contexte (KV cache) doit être relu en intégralité entre deux tokens sorry
il y a des manières hybrides (manba/ssm qui foutent des quantifications différenciées suivant les tokens) ou de la compression comme deepseek le fait ; mais sans ça sous 32/64 c'est chaud visiblement


Godzil (./854) :
Tu as besoin de ram ce n’est pas possible autrement. Le modèle prends de la place en mémoire mais tu as aussi besoin de faire tous les calculs et il y a pas mal de besoin mémoire juste sur ce point.

QUE pour le contexte, le think va aussi dans le contexte ; (mais je trouve que c'est un soucis actuel il faudrait que le contexte soit repris/éclairci/nettoyé en live, la c'est n'imp)