Une guerre tranquille se déroule sous le boom de l’IA, et la plupart des gens ne prêtent pas attention au front droit. Alors que les gros titres se concentrent sur le modèle gagnant, la startup qui collecte des fonds ou le chatbot qui gagne des utilisateurs, une course parallèle se joue dans les centres de données et les salles de conseil d’administration des entreprises du monde entier. La course est à l’infrastructure de l’IA : les clusters GPU, les contrats d’alimentation, les systèmes de refroidissement, la structure réseau, les outils d’orchestration et les services d’inférence qui font réellement fonctionner l’IA moderne. Les entreprises qui participent à cette course sont appelées néoclouds.

Comprendre l’importance des néoclouds est important pour la même raison que comprendre le cloud computing était important en 2008. Les entreprises qui ont été les premières à voir le passage au cloud et à s’y positionner correctement ont fini par contrôler une couche massive de l’industrie technologique. La même dynamique se joue actuellement dans l’infrastructure de l’IA. Mais le marché du néocloud est plus compliqué qu’il n’y paraît. Toutes ces entreprises ne font pas la même chose. Les regrouper comme s’il s’agissait uniquement d’entreprises de location de GPU passe complètement à côté de l’essentiel. La manière la plus utile de comprendre l’espace est de reconnaître que les néoclouds évoluent en quatre catégories distinctes, chacune avec un objectif différent, un client différent et un rôle différent dans la pile d’IA.

Qu’est-ce qu’un néocloud ?

Avant d’entrer dans les catégories, il est utile d’établir ce que signifie le terme. Un néocloud est un fournisseur d’infrastructure cloud conçu spécifiquement pour les charges de travail d’IA. Cela semble simple, mais cela couvre beaucoup de terrain. Les hyperscalers à usage général comme AWS, Azure et Google Cloud ont été conçus pour prendre en charge une grande variété de charges de travail dans de nombreux secteurs. Ils ont construit une architecture autour de la flexibilité, de l’étendue des services et d’un large attrait pour l’entreprise. Neoclouds a adopté une approche différente. Ils se sont construits autour d’un seul mandat : rendre le calcul de l’IA aussi rapide, dense et évolutif que possible.

Cela signifie concevoir des installations autour d’une densité de puissance élevée, intégrer des interconnexions rapides entre les GPU, investir dans le refroidissement liquide et le refroidissement économe en énergie, et créer une orchestration autour d’outils tels que Kubernetes et Slurm spécialement conçus pour la formation distribuée en IA. Cela signifie également une concurrence agressive pour l’accès aux derniers accélérateurs Nvidia, car dans l’infrastructure d’IA, l’accès au GPU est souvent l’avantage concurrentiel le plus important qu’une entreprise puisse avoir.

Le résultat est un marché fragmenté mais profondément concurrentiel. Certains néoclouds se concentrent sur la capacité physique. Certains visent à rendre le calcul GPU accessible aux développeurs. Certains construisent une infrastructure de niveau entreprise qui peut rivaliser directement avec les hyperscalers dans des domaines spécifiques de l’IA. Et certains se concentrent sur l’un des enjeux à long terme les plus importants de l’IA : l’inférence. Regardons de plus près les quatre catégories de néoclouds.

Infrastructure d’IA full-stack

La première et la plus importante catégorie est celle des fournisseurs d’infrastructures d’IA full-stack. Ces sociétés tentent de devenir les AWS de l’ère de l’IA, mais elles sont dès le départ construites autour de GPU plutôt que de calculs à usage général. Leur objectif est de posséder autant d’expérience que possible en matière d’infrastructure d’IA : clusters GPU bruts, mise en réseau, stockage, orchestration, Kubernetes géré, planification Slurm, clusters privés, support d’entreprise, charges de travail de formation et services d’inférence.

Les entreprises présentes dans cet espace comprennent CoreWeave, Nebius, Lambda, Crusoe, Nscale et Fluidstack. CoreWeave est apparu comme l’exemple le plus clair de cette catégorie. Il a construit son identité autour de clusters GPU massifs optimisés pour la formation à l’IA à grande échelle, associés à une orchestration native Kubernetes et à des contrats d’entreprise d’une valeur de plusieurs milliards. Nebius a emprunté une voie différente, combinant une expertise approfondie en ingénierie avec une stratégie souveraine et orientée vers l’Europe tout en se développant fortement dans les centres de données américains. Lambda a commencé comme un cloud GPU convivial pour les développeurs et les chercheurs pour l’apprentissage automatique, mais a délibérément évolué vers une montée en gamme, en ajoutant des superclusters et des services de cluster privés.

Clouds GPU pour développeurs et libre-service

La deuxième catégorie concerne les cloud GPU pour développeurs et libre-service. Ces plateformes ne sont pas en concurrence pour des contrats d’entreprise d’un milliard de dollars. Ils sont en concurrence pour les développeurs, les startups, les chercheurs et les petites équipes qui ont besoin d’un accès rapide au GPU sans négocier d’accords à long terme. L’expérience produit ici est en libre-service : choisissez un GPU, lancez une instance, déployez un modèle, exécutez un notebook, testez une charge de travail ou lancez un petit cluster.

Les marques qui correspondent ici incluent Vultr, Runpod, Civo, Lambda et Together AI. Vultr intègre le calcul GPU dans une plate-forme cloud plus large avec une empreinte mondiale et un déploiement en libre-service. Runpod a construit une clientèle de développeurs fidèles en gardant l’expérience simple et rapide. Civo cible les développeurs qui préfèrent un environnement Kubernetes-first. Lambda propose toujours de solides instances GPU en libre-service et des clusters 1-Click parallèlement à ses offres d’entreprise. Together AI va au-delà de la location de GPU bruts pour combiner l’inférence, le réglage fin, l’hébergement de modèles et les clusters dédiés dans une seule plate-forme accessible aux développeurs.

Cette catégorie est importante car toutes les équipes d’IA n’ont pas besoin de milliers de GPU et d’un gestionnaire de compte dédié. De nombreux travaux importants se déroulent au niveau du laboratoire de recherche, au stade du prototype de démarrage et au niveau des développeurs individuels. Ces cloud servent ce marché et se transforment souvent en comptes plus importants à mesure que les équipes évoluent.

Clouds d’IA axés sur l’inférence

La troisième catégorie, de plus en plus importante, est celle des nuages ​​d’IA axés sur l’inférence. La formation fait la une des journaux, mais l’inférence est le domaine où les produits d’IA vivent réellement. Chaque réponse du chatbot, l’achèvement de l’assistant de codage, l’interaction de l’agent vocal et la demande de génération d’image sont des inférences. Et contrairement à la formation, qui se déroule par rafales, l’inférence s’exécute toute la journée, tous les jours, pour chaque utilisateur.

Les entreprises à surveiller incluent Together AI, Groq, CoreWeave Inference, Nebius Token Factory, Crusoe Managed Inference et Nscale Serverless Inference. Together AI a construit l’une des plates-formes d’inférence les plus claires du marché, en particulier pour les modèles open source et open-weight, tout en prenant également en charge le réglage fin et les clusters GPU dédiés. Groq se distingue car son identité est liée à une inférence ultra-rapide exécutée sur sa propre architecture d’unité de traitement de langage (LPU), qui inverse le paradigme GPU traditionnel. CoreWeave Inference étend l’histoire de l’infrastructure de CoreWeave au service de modèles dédiés et sans serveur. Nebius Token Factory et Crusoe Managed Inference représentent la manière dont les acteurs full-stack ajoutent des couches d’inférence pour monétiser différemment leur capacité GPU. Nscale Serverless Inference est l’évolution de Nscale vers un modèle de service à la demande sans gestion d’infrastructure.

Ce qui rend cette catégorie si intéressante, c’est l’orientation économique. À mesure que l’IA passe d’une poignée de grands laboratoires pionniers à des millions d’applications de production, la demande en infrastructure d’inférence va probablement éclipser la demande de formation. Les entreprises qui contrôlent la capacité d’inférence pourraient finir par contrôler le flux de revenus à long terme, plus durable.

Acteurs de centres de données et à forte capacité

La quatrième catégorie est la plus ancrée physiquement. Ce sont ces entreprises qui construisent et contrôlent l’immobilier de l’IA. Cela va au-delà des nuages ​​​​GPU au sens traditionnel du terme. Ces entreprises acquièrent des terrains, concluent des contrats d’électricité, conçoivent des centres de données, développent des campus, déploient des racks haute densité et se précipitent pour contrôler une capacité qui ne peut réellement pas être reproduite rapidement.

Les marques qui correspondent ici incluent Fluidstack, Applied Digital, Core Scientific, Voltage Park, Crusoe et Nscale. Certaines de ces entreprises proposent également des services cloud, mais leur avantage stratégique réside fondamentalement dans la maîtrise de leur infrastructure physique. Fluidstack est spécialisé dans la fourniture de capacités de cluster GPU personnalisées à grande échelle et de solutions de centres de données personnalisées pour les entreprises et les laboratoires d’IA. Applied Digital fournit une infrastructure d’hébergement pour l’IA et le calcul haute performance à grande échelle. Core Scientific est passé des centres de données de crypto-minage à l’infrastructure d’IA. Voltage Park se concentre sur la capacité GPU à grande échelle pour les organismes d’IA et de recherche.

Crusoe et Nscale apparaissent dans cette catégorie ainsi que dans d’autres, ce qui touche au cœur de l’un des points les plus importants du marché du néocloud dans son ensemble. Ces catégories ne sont pas des cases propres. Les entreprises sont généralement réparties dans plusieurs catégories et la pression concurrentielle pousse la plupart d’entre elles à élargir leur champ d’action. Crusoe est à la fois un fournisseur de cloud et un développeur de centres de données. Nscale est à la fois une plateforme cloud et un constructeur d’infrastructure majeur. Les entreprises qui gagneront en fin de compte seront peut-être celles qui parviendront le plus efficacement à couvrir les quatre catégories.

Pourquoi le cadrage des catégories est important

Comprendre ces catégories n’est pas seulement un exercice académique. Cela a de réelles conséquences sur la manière dont les entreprises prennent leurs décisions d’achat, sur la manière dont les investisseurs évaluent l’espace et sur la façon dont les leaders technologiques réfléchissent à la stratégie d’infrastructure d’IA.

Une entreprise axée sur la capacité physique joue un jeu fondamentalement différent de celui qui vend des API d’inférence gérées. Ils peuvent apparaître dans les mêmes articles technologiques et rivaliser pour certains des mêmes titres, mais leurs aspects économiques, leurs relations clients et leur différenciation à long terme semblent très différents. Du point de vue d’un acheteur d’entreprise, il est important de comprendre sur quelle couche vous achetez réellement avant de signer un contrat. Certains néoclouds établissent des relations de plateforme à long terme. D’autres offrent la capacité de combler une lacune immédiate. La catégorie détermine lequel est quoi.

Le marché du néocloud est jeune, en évolution rapide et véritablement compliqué. Les nouveaux entrants, les fusions et acquisitions et l’expansion des plateformes remodèlent le paysage en temps réel. Mais la logique sous-jacente reste constante. L’infrastructure de l’IA devient une couche critique de la pile technologique, et quiconque contrôle cette couche aura une énorme influence sur la façon dont l’IA est construite, déployée et monétisée.

Les entreprises présentes sur ce marché ne sont pas toutes pareilles. Prêter attention à ce qu’ils font réellement, plutôt qu’à ce qu’ils s’appellent, est la manière de séparer ceux qui façonneront l’avenir de l’IA de ceux qui ont simplement été les premiers à envoyer un communiqué de presse.

A lire également