Oui, c'est bien possible. Nvidia va devenir de plus en plus indispensable sur l'IA.

<<< Kernel Extremis©®™ >>> et Inventeur de la différence administratif/judiciaire ! (©Yoshi Noir)
<Vertyos> un poil plus mais elle suce bien quand même la mienne ^^
<Sabrina`> tinkiete flan c juste qu'ils sont jaloux que je te trouve aussi appétissant
nvidia fourni gratuitement l'infrastructure et l'accès à de nombreux modèles ; c'est un peu la continuité de la chose
pour l’hégémonie nvidia, avec ce qui s'est passé la semaine dernière concernant oxalpha :
modèle surprise en "stealth" ; très puissant et foutu à disposition gratuitement au monde en illimité durant une semaine
au final c'était glm-5.3-flash et il tournait intégralement sur des chip chinois ;
la chine a donc fait tourner un modèle que la terre entière a saigné au max, seulement sur du matos "maison", c'est un gros tournant je trouve, et c'est bien
et la le mec il le pécho par le bras et il lui dit '
Tu as tout a fait raison!
L'art ne peut-il donc être industriel ? Quid de Mondrian ?
C'est la suite logique une fois que les modèles stagnent non? Comme les ASIC pour le bitcoin. Si l'amélioration incrémentale des modèles vaut moins que le gain financier du matériel dédié, ça va prendre.
Genre sur un téléphone.

With your feet in the air and your head on the ground
Try this trick and spin it, yeah
Your head will collapse
But there's nothing in it
And you'll ask yourself
Where is my mind
Model en “hard” aka faire un asic qui ne fait qu’un model n’a vraiment aucun intérêt.
Les accélérateur non GPU existent déjà, et sont massivement utilisé dans les smartphones entre autre.
Autre exemple Groq (Q pas K) a des asic pour accélérer les inférences.

Proud to be CAKE©®™
GCC4TI importe qui a problème en Autriche, pour l'UE plus et une encore de correspours nucléaire, ce n'est pas ytre d'instérier. L'état très même contraire, toujours reconstruire un pouvoir une choyer d'aucrée de compris le plus mite de genre, ce n'est pas moins)
Stalin est l'élection de la langie.
ils existent mais demandent de la ram ; la c'est globalement de la rom en dur,;alors certes tu es bloqué sur un modèle, mais ça coûterais extrêmement peu cher,à produire.
j’imagine aussi bien les grosses boites faire leurs modèles en dur pour les servir super vite ; puis à la nouvelle itération revendre les puces aux fournisseurs tiers.
enfin je sais pas mais les cartes graphiques coûtes 5000€ la, c'est n’importe quoi, si tu peux avoir un modèle stable et éprouvé pour 500 ou 1000€, te permettant de le faire tourner chez toi pour quelques watts sans abonnement à la con, sans limite de session ou de semaine, tout en remettant ram et gpu à un prix décent ben moi je signe.
et la le mec il le pécho par le bras et il lui dit '
Tu as besoin de ram ce n’est pas possible autrement. Le modèle prends de la place en mémoire mais tu as aussi besoin de faire tous les calculs et il y a pas mal de besoin mémoire juste sur ce point.

Proud to be CAKE©®™
GCC4TI importe qui a problème en Autriche, pour l'UE plus et une encore de correspours nucléaire, ce n'est pas ytre d'instérier. L'état très même contraire, toujours reconstruire un pouvoir une choyer d'aucrée de compris le plus mite de genre, ce n'est pas moins)
Stalin est l'élection de la langie.
Si les poids sont stockés en ROM, il faut beaucoup de RAM pour l'inférence?

With your feet in the air and your head on the ground
Try this trick and spin it, yeah
Your head will collapse
But there's nothing in it
And you'll ask yourself
Where is my mind
Slop qui est du pure slop halluciné.
Pas grand chose la dedans semble correct ou même intéressant en terme de concept.
Melbou: de la rom, ça reste de la mémoire. Ça prendre de la place même si c’est probablement un poil plus petit que de la dram. Et ça c’est uniquement si c’est de la rom et pas de la Flash.

Proud to be CAKE©®™
GCC4TI importe qui a problème en Autriche, pour l'UE plus et une encore de correspours nucléaire, ce n'est pas ytre d'instérier. L'état très même contraire, toujours reconstruire un pouvoir une choyer d'aucrée de compris le plus mite de genre, ce n'est pas moins)
Stalin est l'élection de la langie.
c'est pas du slop c'est 2h de recherche sur le sujet, test de différentes solutions etc ... tu penses que c'est l'ia qui a voulu externaliser la "rom", recycler un vieux socket ou faire une version avec / sans asic ? ou même foutu l'asic dans la carte "mère" ?
l'ia c'est internet complet, elle connaît les dimensions des sockets, calcule en 3s après ma demande qu'avec x chip ram 4GB et x pins du sockets ça passe, le taux de remplissage pour une rom pure vs de la ram (x6 en l’occurrence), ou suivant la finesse sur telle surface, le prix d'un masque 3/6nm (c'est elle qui a dit le 18/24nm par contre! dessous c’était pas possible économiquement , mais ont fout déjà du TB dans la taille de ce socket à 8$), qu'il faut foutre un gnd toute les 3 cellules si ont fait des lectures concurrentes etc, elle calcule les vitesses de bus et autre, c'est un outils, ça élague des branches direct ... après oui il faut la guider ... mais je ne vais rien apprendre à personne.
et elle connaissait presque le format de post du forum haha
mais ceci dit ça a fait ressortir le soucis de la ram, le 15k de taalas est pour un contexte vide, il faut lire le contexte complet entre chaque token, aller taper la ram système c'est trop lent, mettre des slots ddr c’était bien trop cher, souder 8 chip de 4 ou 8GB bien mieux pour la vitesse et bien moins cher, bref 2h marrantes et intéressantes ou j'ai appris des trucs.
d'ailleurs je ne pensais pas que le contexte prenais tellement de ram Oo genre vraiment beaucoup (jusqu'à 64k/token!), ici glm passe pas par exemple mais deepseek qui à nativement une compression du contexte (MLA) c'est ok sous 32GB pour 1M de contexte.
mais je retournerais plutôt lui demander la météo au lieu de regarder la faisabilité technique d'un délire.
et la le mec il le pécho par le bras et il lui dit '