Locally AI : un LLM dans la poche, sans cloud, sans compte
On a beau être en 2026, la majorité des IA qu’on utilise au quotidien ont un point commun : elles tournent quelque part sur un serveur, loin de vous. Vos questions partent dans le cloud, une réponse revient. Rapide, pratique, et totalement opaque sur ce qui se passe entre les deux. Locally AI prend le contre-pied de tout ça. L’app fait tourner de vrais LLM directement sur votre iPhone, iPad ou Mac, sans connexion, sans compte, sans que vos données ne quittent jamais votre appareil. Voici mon retour après quelques semaines d’utilisation.
Pour la petite histoire
Locally AI est développée par Adrien Grondin et disponible sur l’App Store depuis début 2025. L’app s’appuie sur MLX, le framework de machine learning d’Apple conçu spécifiquement pour tirer parti de l’architecture de mémoire unifiée des puces Apple Silicon. En clair : sur un iPhone 15 Pro ou un Mac M-series, le modèle a accès à la même mémoire que le reste du système, ce qui change tout à la vitesse d’inférence. Pas de transfert entre RAM et VRAM comme sur PC, juste de la mémoire partagée à haute bande passante.
Le catalogue de modèles supportés est déjà conséquent : Llama (Meta), Gemma (Google, dont la version 4 disponible depuis quelques jours), Qwen (Alibaba), DeepSeek, SmolLM (Hugging Face), Granite (IBM) et d’autres. Tous en open weights, tous téléchargeables depuis l’app, tous exécutés localement.
Qu’est-ce que ça donne concrètement ?
Le téléchargement et le premier lancement
L’expérience commence par choisir un modèle dans la bibliothèque intégrée. Les modèles sont classés par taille et par famille, avec le poids indiqué clairement. Un Gemma E2B pèse environ 4,4 Go, un Qwen 2.5 de 3B tourne dans les mêmes eaux. Pour un iPhone avec 8 Go de RAM, les modèles 1B à 4B sont le sweet spot. Sur iPad Pro ou Mac, on peut monter plus haut.
Le téléchargement se fait directement dans l’app, une fois seulement. Après ça, plus besoin d’internet. Pas de token à récupérer, pas d’API key, pas d’écran de connexion. On télécharge, on lance, on discute.
Les performances sur iPhone
Sur iPhone, la surprise vient des performances. Les modèles 1B à 4B répondent franchement bien, avec une fluidité qu’on n’attendait pas forcément sur un téléphone. Sur Mac, c’est encore plus convaincant : les modèles plus lourds tournent sans friction, et l’expérience se rapproche réellement de ce qu’on a avec une interface cloud. MLX fait clairement la différence ici.
Ce qui se distingue vraiment
La liste des fonctionnalités intégrées est plus fournie que la plupart des concurrents dans cette catégorie. Le voice mode fonctionne entièrement on-device : reconnaissance vocale et synthèse, sans aucun appel réseau. C’est rare, et ça compte quand on parle de confidentialité.
L’intégration Siri permet de déclencher une conversation via « Hey, Locally AI ». L’app s’intègre aussi avec les Raccourcis Apple, ce qui ouvre des possibilités d’automatisation intéressantes pour ceux qui ont déjà des workflows Shortcuts en place. On peut y accéder depuis le Centre de contrôle ou le bouton Action sur les modèles qui en sont équipés.
Le system prompt personnalisable permet d’orienter le comportement du modèle. Pratique si vous voulez un assistant avec un contexte précis, une langue particulière, ou un rôle défini.
Ce qu’on ne vous dit pas toujours
L’app est sérieuse, mais quelques points méritent d’être posés clairement.
L’app indique elle-même si un modèle est adapté à votre appareil, avec des infos sur l’usage CPU et les capacités visuelles avant même le téléchargement. Pratique pour éviter les mauvaises surprises. Mais ça ne change pas le fait que les modèles les plus récents demandent de la place : Gemma 4 en version E4B, c’est 6,3 Go. Si votre iPhone est déjà bien rempli, il faudra faire des choix.
La qualité dépend du modèle choisi. Ce n’est pas Locally AI qui est plus ou moins intelligent, c’est le modèle que vous avez sélectionné. Llama 3.2 3B et Qwen 3 4B ne donnent pas les mêmes résultats. Il faut tester, ajuster, et accepter que certains modèles seront meilleurs que d’autres sur vos cas d’usage précis.
Les revendications marketing type « rival de GPT-4 » s’appuient sur des benchmarks très spécifiques. Dans l’usage quotidien, ce n’est pas GPT-4o que vous avez en face, et ce n’est pas ce qu’on lui demande non plus. Et cela fonctionne super bien. Les performances chez moi sont au rendez-vous.

Enfin, l’app reste jeune. L’interface est propre et le support iOS 26 Liquid Glass est déjà là, ce qui montre que le développeur suit de près les évolutions d’Apple. Mais le catalogue et certaines fonctionnalités continueront d’évoluer.
Pour qui c’est fait ?
Locally AI répond à un vrai besoin pour plusieurs profils.
Pour ceux qui travaillent régulièrement sans connexion fiable : avion, zones blanches, déplacements. Un assistant IA offline, c’est une vraie différence.
Pour ceux qui ont des exigences de confidentialité non négociables : journalistes, avocats, médecins, ou simplement les gens qui ne veulent pas que leurs conversations alimentent un dataset quelque part. Quand tout tourne localement, la question ne se pose pas.
Et pour les curieux de l’open source qui veulent comprendre concrètement ce que Llama ou Qwen donnent dans la vraie vie, sans passer par une interface cloud qui masque tout ce qui se passe dessous.
J’avais déjà documenté les limites de l’IA sur iPhone dans mon article sur le Cloudflare MCP Portal : iOS ne peut pas faire tourner de serveurs MCP en background, ce qui bloque une bonne partie des workflows avancés. Locally AI ne règle pas ce problème, mais il répond à un autre besoin, différent : avoir un modèle de langage qui fonctionne, point, sans infrastructure.
Mon retour
L’app fait ce qu’elle promet. Le côté « zéro cloud, zéro compte » est réel et bien exécuté. Sur Mac, c’est franchement convaincant. Sur iPhone aussi, et c’est là la vraie surprise : les modèles dans la tranche 1B-4B tournent bien mieux qu’on ne l’imaginerait sur un téléphone.
Ce qui me plaît surtout, c’est la direction. Faire tourner un LLM multimodal comme Gemma 4 sur un iPhone en 2026, c’est quelque chose qui n’était tout simplement pas possible il y a deux ans. Et l’écosystème de modèles open source évolue vite : dans six mois, les modèles qui tiennent dans 4 Go seront meilleurs que ceux qui existent aujourd’hui.
Si la confidentialité de vos échanges avec une IA vous importe, ou si vous voulez juste savoir ce que ça donne de faire tourner un LLM en local sur votre matériel Apple, Locally AI est une bonne porte d’entrée. L’app est gratuite, les modèles aussi. Rien à perdre à essayer.
N’hésitez pas à partager votre expérience en commentaires, notamment quel modèle vous avez trouvé le plus équilibré sur votre appareil.
Conversation
Ce site utilise Akismet pour réduire les indésirables. En savoir plus.