Google presenta Nano Banana 2 Lite i Gemini Omni Flash com una resposta directa al gran coll d’ampolla de la IA generativa: crear imatges i vídeos amb més velocitat, menor cost i fluxos de treball capaços de passar de la idea al producte audiovisual en pocs minuts.
Google ha fet un nou pas en la cursa per convertir la intel·ligència artificial generativa en una eina de producció massiva, i no només en una demostració tecnològica. La companyia ha presentat Nano Banana 2 Lite i ha obert als desenvolupadors Gemini Omni Flash, dos models orientats a resoldre una de les grans tensions actuals del sector: com generar imatges i vídeos de qualitat amb costos més baixos, menys latència i una integració més senzilla en productes reals. La novetat no consisteix únicament en el fet que Google disposi d’un nou model d’imatge i un altre de vídeo. El més rellevant és que tots dos formen part d’una mateixa estratègia: construir una cadena creativa completa, ràpida i econòmicament viable per a desenvolupadors, empreses, agències, creadors i plataformes.
L’anunci oficial es pot consultar al blog de Google, on la companyia explica les característiques tècniques dels nous models i la seva integració dins de l’ecosistema Gemini.
L’anunci arriba en un moment especialment significatiu. Durant els darrers anys, la IA generativa ha avançat a una velocitat extraordinària en text, imatge, àudio i vídeo. Tanmateix, l’adopció empresarial i creativa s’ha trobat amb obstacles molt concrets: els models més potents són cars, la generació visual encara pot resultar lenta, la qualitat no sempre és estable, l’edició de vídeo continua essent complexa i molts fluxos de treball depenen de diverses eines independents. Google vol atacar precisament aquest problema amb una combinació de models més eficients, integrats dins de Gemini API, Google AI Studio, Gemini Enterprise Agent Platform i també dels seus productes de consum, com l’aplicació Gemini, AI Mode a Search o Google Flow.
Nano Banana 2 Lite és la gran aposta en generació d’imatges. Google el presenta com el model més ràpid i eficient en costos de tota la família Gemini Image. El seu nom tècnic és gemini-3.1-flash-lite-image i està pensat per a escenaris on la rapidesa, l’escalabilitat i el cost tenen més importància que no pas el màxim nivell de detall artístic. L’objectiu no és substituir Nano Banana Pro, sinó oferir una alternativa d’alt rendiment per a ideació ràpida, prototipatge visual, generació massiva d’imatges, esbossos, comerç electrònic, màrqueting o qualsevol flux on el volum sigui determinant.
Una de les dades més destacades és la latència. Google assegura que Nano Banana 2 Lite és capaç de generar una imatge en aproximadament quatre segons. Pot semblar un detall menor, però representa un canvi important en la manera de treballar dels equips creatius. La creativitat basada en IA depèn cada vegada més de la capacitat d’iterar. Ja no es tracta d’obtenir una única imatge perfecta, sinó de generar desenes o centenars de versions successives fins a trobar la millor proposta. Una generació gairebé instantània manté el ritme creatiu i permet experimentar molt més.
També és rellevant el cost. Google fixa el preu en 0,034 dòlars per imatge de resolució 1K, una xifra que evidencia que la batalla entre els grans laboratoris ja no es lliura únicament sobre la qualitat dels models, sinó també sobre l’economia de la inferència. Per a plataformes de comerç electrònic, estudis de videojocs, agències de publicitat o empreses que necessiten generar milers d’imatges cada dia, el cost unitari és tan important com la qualitat final.
Google recomana Nano Banana 2 Lite als desenvolupadors que encara utilitzen la primera generació de Nano Banana, assegurant millores tant en qualitat com en velocitat i eficiència econòmica. La família queda estructurada en tres nivells: Nano Banana 2 Lite, orientat a la màxima velocitat; Nano Banana 2, com a model equilibrat; i Nano Banana Pro, destinat als usos més exigents en qualitat visual i control creatiu.
Aquesta segmentació reflecteix una evolució madura del mercat. Durant els primers anys de la IA generativa es parlava d’un únic model capaç de fer-ho tot. Avui els grans proveïdors prefereixen construir famílies de models adaptades a necessitats molt diferents. No tots els usuaris requereixen el màxim nivell de qualitat en totes les tasques. Alguns necessiten rapidesa; d’altres, baix cost; altres prioritzen la coherència dels personatges, la qualitat del text dins de la imatge o la precisió artística. Google està convertint la generació visual en una oferta modular.
La segona gran novetat és Gemini Omni Flash, el model de vídeo que Google havia avançat durant Google I/O i que ara posa a disposició dels desenvolupadors mitjançant Gemini API i Google AI Studio. El seu nom tècnic és gemini-omni-flash-preview. La proposta és especialment ambiciosa: generar i editar vídeo mitjançant llenguatge natural, combinant text, imatges i vídeo dins d’un mateix flux de treball.
Aquest aspecte pot marcar una diferència important respecte als sistemes actuals. La generació de vídeo ha fet un salt espectacular durant l’últim any, però l’edició continua essent un dels grans reptes. Crear un vídeo és útil; poder modificar-lo simplement parlant amb el model és molt més interessant. Canviar una escena, substituir un objecte, modificar el moviment de càmera, mantenir la coherència d’un personatge o adaptar un vídeo als comentaris d’un client sense començar de zero pot transformar completament els processos creatius.
Google destaca quatre grans capacitats d’Omni Flash: edició conversacional de vídeo, referències multimodals, coneixement del món real i sincronització entre text i accions. L’edició conversacional permet modificar un vídeo simplement descrivint els canvis desitjats. Les referències multimodals permeten combinar imatges, textos i vídeos per mantenir el control sobre l’escena. El coneixement del món real ajuda el model a generar resultats més coherents. Finalment, la sincronització entre text i accions facilita que gràfics, subtítols i altres elements visuals apareguin exactament quan correspon dins de la seqüència.
El preu també evidencia la voluntat de competir en eficiència. Google situa Gemini Omni Flash en 0,10 dòlars per segon de vídeo, un nivell similar al de Veo 3.1 Fast. Això confirma que el vídeo generatiu entra també en una fase on el cost serà tan determinant com la qualitat.
Google admet que encara existeixen limitacions. Actualment, Omni Flash genera vídeos de fins a deu segons. Encara no permet utilitzar referències d’àudio ni ampliar automàticament les escenes. La coherència dels personatges també pot variar quan hi ha canvis importants de càmera. Aquesta transparència resulta especialment rellevant en un moment en què moltes empreses tendeixen a exagerar les capacitats dels seus models.
El més interessant apareix quan tots dos models treballen conjuntament. Google proposa un flux creatiu on Nano Banana 2 Lite genera ràpidament una imatge i Gemini Omni Flash la converteix posteriorment en un vídeo animat. Aquesta connexió entre imatge i vídeo pot modificar profundament la manera de produir continguts. La imatge deixa de ser un resultat final per convertir-se en una etapa intermèdia dins d’un procés audiovisual complet.
La companyia ha desenvolupat diversos exemples per mostrar aquest enfocament. Anywhere permet crear una fotografia en qualsevol lloc del món a partir d’una selfie i després animar-la amb Omni Flash. Space Lift transforma una fotografia d’una habitació en un projecte complet de decoració amb una presentació audiovisual. Omni Product Studio converteix fotografies de productes en vídeos comercials preparats per a comerç electrònic.
No són simples demostracions tecnològiques. Reflecteixen tres mercats especialment atractius: el contingut personalitzat, el disseny d’interiors i el comerç electrònic. En tots tres casos, la IA pot reduir dràsticament els costos de producció audiovisual i multiplicar la capacitat creativa.
Google també deixa clara una altra ambició: integrar aquests models dins de tot el seu ecosistema. Gemini, Search, Google Photos, NotebookLM, Google Ads, Google Flow, AI Studio o Google Cloud passen a compartir una mateixa infraestructura multimodal. Això pot convertir Gemini en molt més que un assistent conversacional. Pot esdevenir la plataforma central de creació visual de milions d’usuaris.
Especialment rellevant és la integració prevista amb Google Ads. Si els anunciants poden generar imatges, vídeos, variacions creatives i campanyes completes directament des de la plataforma publicitària, Google reforçarà encara més la seva posició dins del mercat global de la publicitat digital.
L’anunci també posa èmfasi en la seguretat. Tant Nano Banana 2 Lite com Gemini Omni Flash incorporen SynthID, el sistema de marca d’aigua desenvolupat per Google per identificar contingut creat amb intel·ligència artificial. A més, Google preveu oferir eines de verificació dins de Gemini, Search i Chrome perquè els usuaris puguin identificar continguts sintètics.
Aquest aspecte serà cada vegada més rellevant. A mesura que generar imatges i vídeos resulti més fàcil, també augmentaran els riscos de desinformació, deepfakes, manipulació i frau. La identificació de contingut sintètic es convertirà previsiblement en un requisit tant regulador com reputacional.
Aquest llançament també s’ha d’entendre dins de la intensa competència entre Google, OpenAI, Anthropic, Meta, Runway, Adobe, xAI i els grans laboratoris asiàtics. La diferència és que Google no pretén competir únicament amb models més potents. Vol construir una infraestructura multimèdia completa, capaç de generar, editar, distribuir i integrar contingut dins del seu ecosistema.
La paraula clau és eficiència. La indústria ha comprovat que els models gegants comporten costos enormes en computació, memòria, energia i centres de dades. Els laboratoris que aconsegueixin oferir un rendiment similar amb menys recursos disposaran d’un avantatge competitiu molt important. Nano Banana 2 Lite respon exactament a aquesta filosofia. Gemini Omni Flash fa el mateix en l’àmbit del vídeo.
Google no només presenta dos models nous. Presenta una nova manera d’entendre la producció creativa basada en IA: ràpida, conversacional, integrada, econòmicament sostenible i preparada per escalar dins de milions d’aplicacions. La batalla ja no consisteix únicament a generar la millor imatge o el vídeo més espectacular. Es tracta de construir eines capaces d’acompanyar els creadors en el seu treball quotidià.
Si aquesta estratègia funciona, Gemini deixarà de ser únicament un model conversacional per convertir-se en una plataforma multimèdia completa. La IA generativa entra així en una nova etapa: menys demostracions espectaculars i més producció real, contínua, integrada i eficient.