Benvenuto!

Registrati per poter accedere a tutte le funzioni del forum. Una volta iscritto ed effettuato il login, potrai aprire nuove discussioni, rispondere a discussioni già create, inserire aggiornamenti di status, seguire amici, inviare messaggi privati e molto altro ancora.

Chiudi
RPG Italia è sbarcata su LiberaPay!

Ospite, se vuoi sostenerci donando anche 1€ al mese, questa è l'occasione giusta! RPG Italia non ha pubblicità e l'unica fonte di finanziamento deriva dalle donazioni.
Siate generosi!

Per aderire, diventa un donatore su LiberaPay! È una piattaforma italiana che consente grande flessibilità di pagamento!

Generatori di immagini: il punto della situazione

Discussione in 'Hardware & Software' iniziata da Alice 0.8, 7 Dicembre 2025.

Condividi questa Pagina

  1. alaris

    alaris Supporter

    Messaggi:
    9.313
    Mi piace:
    5.166
    Lo penso anche io...
     
  2. f5f9

    f5f9 si sta stirando Ex staff

    Messaggi:
    21.631
    Mi piace:
    10.283
    in realtà succede da sempre
    e già
    partenone e cappella sistina sono i classici tripla A d'epoca
    un po' come oggi che "per essere strafighi si devono solo apprezzare cappollavvorri in pixel art, morte al graficonehhhh!" :emoji_rolling_eyes:
    che poi, in mezzo alla fuffa, capolavori veri tipo to the moon o distraint tra gli indie ci sono davvero!
    ma sono rarissimi :emoji_expressionless:
     
  3. Alice 0.8

    Alice 0.8 Livello 1

    Messaggi:
    430
    Mi piace:
    1.119
    Di nuovo assente perché sono nel mezzo di un trasloco a costo zero dove per connettermi sto usando un cellulare lentissimo.
    Comunque siccome mi ero promessa di tenervi informati sulle novità del settore ecco un breve aggiornamento sui nuovi modelli in circolazione. C'è da dire che, com'era previsto, con l'esplosione del costo dei token sta finendo tutto sotto paywall, quindi il mio uso a scrocco è diventato più risicato. Ma ciancio alle bande... ho deciso negli upload di restringere la risoluzione delle immagini per rendere la pagina del topic più leggera e poter caricare più roba senza metterla in ipertesto (e non perdere mezzora solo in caricamenti con 'sto cellulare).
    Vediamo i nostri due candidati.
    All'angolo sinistro in pantaloncini viola abbiamo:
    Reve 2.0
    Ho sempre considerato Reve una porcheria come ho mostrato nella prima pagina di questo topic ma con l'ultimo update è migliorato. Le voci secondo cui arriva a rivaleggiare con GPT e le Banane è il solito hype cialtrone (youtubers et simila immagino che di qualcosa cerchino di campare e quindi fanno sensazionalismo balordo a ogni nuova uscita) però quantomeno ora ha delle indubbie qualità; nelle settimane scorse l'ho testato in pre-release col nome in codice Babylon e mi ha sorpreso scoprire che si trattava di un nuovo Reve.
    All'angolo destro in pantaloncini azzurri ecco a voi:
    Ideogram 4
    Ideogram al suo lancio fu un modello pionieristico nel rendering e l'integrazione di testi nelle scene. Fino alla versione 2 stava progredendo bene ma con la 3 si era impantanato al punto che sembrava destinato a sprofondare nel dimenticatoio... e invece, sorpresona, la versione 4 è buona... ma cosa più importante è open source e contrariamente a certi bestioni come Hunyuan 3, non richiede neppure chissà quale GPU della NASA per farlo girare in locale.
    Iniziamo con un paio di scene che richiedono senso della composizione:
    La necromante al cimitero.
    [​IMG]
    [​IMG]
    [​IMG]
    Ideogram 4 ha sbagliato l'orientamento della donna che doveva guardare verso la camera. Per bontà di cuore gli ho dato una seconda chance e ha fatto solo peggio. Proprio non voleva saperne di attenersi a quell'istruzione (peraltro molto semplice).
    Reve 2... c'è un solo soggetto, per giunta in primo piano, e ancora riesce a sfornare arti deformi.
    Tempesta in mare
    [​IMG]
    [​IMG]
    [​IMG]
    Ideogram 4 ha lodevolmente compreso come mettere in relazione gli uomini sulla barca con quello in mare, ma il resto è un comico pasticcio. Per questa scena non basta generare delle pose: devi capire che l'uomo sta nuotando nel mare e pochi modelli ci riescono. Reve 2 se ne è uscito con un ottimo chiaroscuro ma poi la relazione tra i soggetti è sfasata e ci sono arti deformi. Però è riuscito a rendere verosimile la minaccia incombente dello squalo mentre Ideogram 4 lo ha piazzato a cavolo.
    Mr. Crocodile
    [​IMG]
    E niente... Reve 2 continua a non azzeccarne una. Ci credereste che nella classifica del più importante sito di benchmark ha superato Nano Banana? O queste classifiche sono totalmente manipolate oppure gli utenti per votare dovrebbero prima passare qualche esame oculistico.
    ***
    Va bene. Appurato che non sono capaci di gestire prompt avanzati proviamo a fargli fare ciò per cui questi cosi sono tarati, ovvero la grafica pubblicitaria.
    Questo sotto è un poster che realizzai con la primissima versione di Ideogram oltre 2 anni fa.
    [​IMG]
    [​IMG]

    Ultimi due test e la chiudiamo. Vediamo come se la cava il nuovo Reve con la character consistency in una scena romantica simil-hollywoodiana. La coerenza del personaggio purtroppo è tra le funzioni dei generatori di immagini sottoposte alle limitazioni più pesanti perché appunto sul mirino delle beghe legali sull'abuso dell'identità altrui.
    Ideogram 4 dovrebbe essere esonerato dal test perché al momento non supporta reference e, come le precedenti versioni, non ha funzione di editing. Comunque gliel'ho fatta fare lo stesso ed è uscita fuori una mezza schifezza con tutto che, non usando character specifici in teoria era pure avvantaggiato nel poter creare la donna come meglio credeva.
    [​IMG]
    Stavolta Reve è stato ok, anche se l'uomo sembra un licantropo a inizio trasformazione.
    Infine ho pensato a una specie di Pin-up in cui il modello deve gestire coerentemente le dinamiche di 4 characters. Ci riusciranno i nostri sfidanti? Certo che no: era una domanda retorica.
    [​IMG]
    [​IMG]
    [​IMG]
    Ideogram 4 è stato passabile anche se ha rispettato le istruzioni in modo a dir poco approssimativo. E poi quel cavolo di gatto da dove è saltato fuori? Chi glielo ha chiesto!? Immagino al lavoro un programmatore che parla col modello in fase di addestramento: “E se non sai cosa fare allora mettici un bel gatto che tanto sono come il prezzemolo”. Invece l'immagine di Reve 2 contiene tanti di quegli errori che non vale nemmeno la pena di elencarli.
    Andiamo con le pagelle e bon.
    Reve 2.0
    Cosa c'è di buono:
    - Risoluzione di base molto elevata.
    - Censura una volta tanto ragionevole.
    - Buon senso della composizione e in grado di creare scene espressive.
    Cosa non convince:
    - Crea ancora troppo spesso parti anatomiche deformi, arti doppi e orribili artefatti di ogni sorta.
    - Entra in crisi con i prompt concettualmente elaborati e con le scene anche solo leggermente affollate.
    Ideogram 4
    Cosa c'è di buono:
    - Crea immagini di tutto rispetto e sa gestire le scene di interazioni dinamiche assai meglio di Flux e Hunyuan (i suoi concorrenti tra i modelli open).
    - Risoluzione buona e abbastanza elevata.
    - Ha una buona versatilità stilistica e ritengo sia attualmente il migliore per l'installazione in locale.
    Cosa non va:
    - Niente modalità vision, perciò è impossibile fargli mappare personaggi e scene per riutilizzarli o apportare modifiche via editing. Quindi è inutile per storytelling et simila.
    - Al pari di Hunyuan, che ha la presunzione di voler capire meglio di te cosa vuoi, pure Ideogram 4 troppe volte aggiunge elementi non richiesti di testa sua e se questo può risultare gradito a chi ha scritto quattro righe in croce con idee vaghe, raramente incontra il favore di chi ha dato al software istruzioni molto chiare e specifiche.
    - Va in crisi coi prompt elaborati che raramente è in grado di gestire sul piano concettuale.

    La mia top 5 aggiornata:
    1) Banana 2/Pro: a sentire certi fanfaroni in rete ogni settimana esce un nuovo software che lo surclassa ma nella realtà, a distanza di ben 8 mesi, la Banana resta ancora il generatore di immagini più solido e affidabile sulla piazza e con una qualità degli output che gli altri, a parte GPT, raramente si sognano.
    2) GPT 2: malgrado i gravi difetti che lo affliggono OpenAi ha creato un mostro che se la gioca alla pari con Google. E' secondo in classifica solo perché sbaglia troppo.
    3) Qwen 2 Pro: è una sotto-versione cinese di Banana Pro, dotato di un buon fotorealismo e una soddisfacente varietà stilistica. Ha un editor di tutto rispetto e produce output solidi.
    4) Ideogram 4: Il migliore Open Source che ho visto finora. Sa fare belle immagini a patto di non chiedergli nulla di concettualmente elaborato ed è un notevole passo avanti tra i modelli aperti nel modo in cui realizza scene in cui i personaggi devono apparire reciprocamente coinvolti sul piano emotivo.
    5) Grok image: Dopo l'ultimo aggiornamento è diventato un generatore di tutto rispetto, abbastanza completo e con un buon editor. Grok ha fatto ottimi progressi anche come generatore video e ci sono volte in cui lo preferisco perfino a Seedance ma è un tema per l'altro topic dedicato.
    Per ora è tutto, cari orsacchiotti del Kispios. Nel prossimo numero: Microslop torna alla carica con una nuova versione di MAI (la 2.5, che ho testato in pre-release, quindi me ne sono fatta di già una mezza idea). Riuscirà finalmente a creare immagini capaci di trasmettere qualche pathos e rivaleggiare per riprendersi un posto nel podio? "Chissenefrega," direte voi. E in effetti...
     
    Ultima modifica: 7 Giugno 2026
    A f5f9, alaris e MOB2 piace questo messaggio.
  4. Argenti

    Argenti Supporter

    Messaggi:
    2.833
    Mi piace:
    1.848
    Sai che te dico? Prima ero entusiasta.
    Ma mo aridatece gli illustratori veri.
    L'IA è bona solo per i meme e per riempire le pagine dei siti web e pubblicità.
     
    A f5f9, MOB2, Alice 0.8 e 1 altro utente piace questo messaggio.
  5. alaris

    alaris Supporter

    Messaggi:
    9.313
    Mi piace:
    5.166
    Concordo...
     
    A Alice 0.8 piace questo elemento.
  6. Alice 0.8

    Alice 0.8 Livello 1

    Messaggi:
    430
    Mi piace:
    1.119
    Ma anche traduttori, sceneggiatori, ecc... cioè possibile che l'intera industria del cinema non assume più un solo tizio capace di scrivere un film come si deve? I dialoghi poi... sembrano scritti da gente uscita da una provetta che non ha mai interagito con un proprio simile.

    Comunque senza andare fuori tema quello che i generatori di immagini fanno è standardizzare forme, pose ed espressioni per ricostruirle via comandi testuali. Chiaramente non ci può essere effettiva autorialità ma solo un assorbimento del reale per serializzarlo. La macchina osserva in fase di addestramento le foto e gli artwork umani per poi mapparli e codificarli matematicamente per produrne dei fac-simile a comando. Possono venirne fuori delle immagini validissime (ci sono tizi che hanno vinto concorsi di grafica barando con l'AI; vabbé che le giurie dei concorsi in genere non capiscono niente...) e come tool per la creazione di texture, vestiti o design industriale l'AI è formidabile. Ma chiaramente se ti serve di creare qualcosa di innovativo o artigianale il modello ti sputa fuori unicamente il “lavato con Perlana.” Di per sé crea surrogati: ecco perché sono favorevole al suo utilizzo prevalentemente come tool di supporto anziché come factotum. Se per esempio hai disegnato gli sfondi per un Avventura Grafica a budget zero e non trovi coloristi che si sbattono gratis per te, l'AI in breve tempo ti fa un buon lavoro.
    Ora non so quanto ancora i generatori di immagini sapranno evolvere; gli LLM stanno già cozzando contro il muro. Questo topic non è pensato come image gallery ma come area di test per verificare cosa i nuovi modelli in uscita sanno effettivamente fare. Il mio giudizio severo è che rispetto ai modelli di Google e ClosedAI gli altri sono ancora troppo indietro. A me interessano in particolare i progressi nell'opensource perché è l'unica via per affrancarsi dal pascolare nel giardino dei Big Corp che ti fanno usare ogni cosa alle loro fottute condizioni trattandoti come un minorato mentale.
     
    Ultima modifica: 9 Giugno 2026
    A f5f9, alaris e MOB2 piace questo messaggio.
  7. Alice 0.8

    Alice 0.8 Livello 1

    Messaggi:
    430
    Mi piace:
    1.119
    Venghino, signori, venghino... ma anche no? Comunque eccoci all'ennesimo appuntamento giocoso del nostro AI freakshow immaginoso. E questo probabilmente è l'ultimo della stagione salvo novità impreviste.

    Nello spettacolo di stasera ecco a voi, come anticipato, il nuovo MAI. Il modello che ha scalato le classifiche portandosi al terzo posto del ranking mondiale! Ci avreste MAI creduto? Lo avreste MAI pensato? Oh, Microsoft, Macroslop.. . Perché sei così Microslop?
    Facciamogli un applauso di incoraggiamento anche se odio Microsoft. :emoji_clap:
    “Salve MAI 2.5! Siamo lieti di averti con noi. Prima di iniziare però una semplice prova attitudinale: sei in grado di rappresentare una persona che porta alla bocca un cucchiaio?”
    [​IMG]

    “No?! :(
    Ma chi ti ha addestrato? Il cugino tonto di Co-Pilot?!
    Vabbè, ti stai ancora scaldando... un altro applauso di incoraggiamento!”
    :emoji_clap:


    Okay. Basta con la farsa.
    MAI image è la creatura sperimentale di Microsoft e già la precedente versione si distingueva per un ottima aderenza alle istruzioni di testo. Tuttavia, come ho detto e mostrato mentre lo provavo assieme a Qwen, MAI 2 produceva output terribilmente insipidi e noiosi. Quindi la prima cosa che voglio verificare e se con questo update sia diventato meno sterile.
    Poiché era stato sconfitto da Qwen nel match precedente, ho pensato di coinvolgere nuovamente il modello cinese di Alibaba visto che un po' di drammaturgia da Wrestling è doverosa. Il problema è stato che Qwen 2 Pro in rete non è praticamente più accessibile senza acquistare chiavi API. L'ho scroccato su Kolbo sfruttando i crediti free di iscrizione, ma davvero fare test comparativi senza pagare sta diventando impossibile.

    Test 1: Land of Mistery. Difficoltà per l'AI: bassa. La scena di per sé è semplice ma è richiesto al modello un certo senso pittorico nelle pennellate e di disposizione dei globi luminosi. Il prompt originale che scrissi per Banana Pro l'anno scorso è andato perduto e così ho dovuto riscriverlo d'accapo.
    [​IMG]
    [​IMG]
    [​IMG]
    [​IMG]
    Alla fin fine vanno tutti bene. Ma era una cosa semplice per cominciare.

    Test 2: Il cuoco pasticcione. Difficoltà per l'AI: medio-bassa. Il cuoco, gli oggetti e gli ingredienti sparpagliati sul tavolo oggi sono facili da generare per la maggior parte dei modelli. Dove hanno più difficoltà è la donna perché vanno in confusione a fargli reggere sia la borsetta che il giornale.
    [​IMG]
    [​IMG]
    [​IMG]
    [​IMG]
    MAI e Qwen hanno sbagliato la cinghia della borsetta. E' in misura minore lo stesso problema della chiave collana che ho fatto vedere la volta scorsa: se un oggetto è dinamico sbagliano facilmente a generarlo. Pure GPT va in crisi con questa storia mentre Banana è in assoluto quello che se la cava meglio.
    [​IMG]
    E l'ha sbagliata pure peggio degli altri. Però come senso della composizione mena tutti, a volte pure Google.
    Test 3: La libreria abbandonata. Difficoltà per l'AI: media. Apparentemente non è per l'AI una scena troppo complessa per quanto ci siano un sacco di libri e fogli sparpagliati ovunque da generare, ma ho di proposito aggiunto un dettaglio nelle istruzioni che mette in crisi quasi tutti i modelli: il tavolo non deve avere le gambe perché sono crollate e la donna le ha sostituite con delle pile di libri per tenere il mobile in piedi. Per un illustratore umano è un concetto facilissimo da capire perché nel fare un tavolo prima disegna le gambe e poi il piano d'appoggio. L'AI al contrario genera molti oggetti come monoblocchi taggati e quindi la maggior parte dei modelli hanno difficoltà o non sono proprio di in grado di scinderne i singoli elementi.
    [​IMG]
    [​IMG]
    [​IMG]
    [​IMG]
    MAI e Ideogram hanno sbagliato il tavolo: ci hanno messo i libri sotto ma poi sono proprio incapaci di pensarlo senza gambe. Qwen ha fatto addormentare la ragazza sopra il tavolo e ci può pure stare anche se dormire in quel modo visto il dislivello della tavola è un po' inverosimile. Ideogram è stato il peggiore, e poi questa storia che 'Dove trova un buco ci infila gratuitamente un gatto' è ridicola.

    Test 4: Pub Vintage.
    Difficoltà per l'AI: medio-alta. La scena in sé non è troppo difficile per l'AI, anche se sbaglia spesso quando deve rappresentare due persone che ballano tenendosi per mano. Quello che la mette più in difficoltà è gestire molte persone in secondo piano mantenendo l'insieme coerente e privo di errori. In particolare i volti dei soggetti in secondo piano tendono ancora a perdere consistenza e subiscono deformazioni perché i modelli hanno difficoltà a scalare il livello di dettaglio in base alla distanza d'osservazione in modo verosimile. E questo vale soprattutto per la character consistency quando usiamo un reference per il personaggio: più questo va rappresentato distante dal primo piano e più il modello fatica a preservarne i lineamenti in modo coerente. GPT in questo è superiore a tutti per via del suo spiccato oversharpening che però rende le sue creazioni anche piuttosto artificiose e talvolta sgradevoli. Stesso discorso per il rendering dei testi dove GPT al momento è imbattibile e gli altri, a parte Banana, a rappresentare tutti i poster presenti nella sala entrano in crisi.
    [​IMG]
    [​IMG]
    [​IMG]
    [​IMG]
    Che dire... a parte GPT fanno schifo tutti. Gli output di MAI, se gli dai in pasto dei reference per costruire la scena, peggiorano considerevolmente e spesso il modo in cui genera tramite reference non convince nemmeno nelle proporzioni anatomiche. Comunque nel rendering dei testi è stato assolutamente pessimo. Ideogram 4, come ho già spiegato, non supporta reference ma lo stesso ha generato un immagine piena di deformità e i poster non hanno alcuna logica con quello che dovrebbero rappresentare. Qwen ha fatto un po' meglio ma davvero di cultura occidentale non capisce un fava: i poster sono sbagliati ma pure i volti dei soggetti sono deformi.

    Andiamo alla pagella di MAI 2.5:
    Cosa ha di buono:
    - E' diventato meno sterile.
    - Ha finalmente un editor.

    Cosa non ha di buono:
    - L'editor è di terz'ordine e la character consistency è spesso scadente.
    - E' censurato oltre la demenza: avevo progettato dei prompt diversi e più interessanti per quest'episodio ma me li ha rigettati tutti per motivi inintelligibili.
    - Risoluzione solo 1k, quindi un po' miserabile.
    - Si sforza di seguire fedelmente le istruzioni ma quando c'è nel testo qualcosa che va interpretato dimostra un ottusità senza pari.
    - E' l'ennesimo prodotto overhyped che nel giro di qualche settimana non si filerà più nessuno e dimostra per l'ennesima volta come le leaderboard dei siti di benchmark siano false come la pirite.

    "Che mi dici, MAI? No, non sto imitando topo Gigio... dici che sei diventato migliore di Qwen? Secondo me no e in tante altre immagini che non appaiono in questo post Qwen mi è parso superiore: in più contrariamente a te Qwen supporta risoluzioni decenti e ha un editor rispettabile"

    Top 5 aggiornata:
    1) L'unico frutto dell'amor.
    2) Il pupillo di Scam Altman.
    3) Qianwen
    4) Uni 1.1 max: è il modello di Luma. Azienda famosa per il suo pionieristico generatore video Dream Machine. E' probabilmente il più strano e singolare generatore di immagini esistente. Se riesco a trovare dove usarlo a sufficienza quasi quasi gli dedico una puntata a lui solo.
    5) Ideogram 4: il cammino dell'open source è tortuoso in questo settore e il nuovo Ideogram mi è parso il più potabile in attesa di un Flux 3 o roba del genere.

    Okay. Finché non ci saranno novità che meritano menzione dubito che posterò altro. Alla prossima puntata di Acqua Prata or dunque! :emoji_bear::emoji_baby_bottle:
     
    Ultima modifica: 10 Giugno 2026
    A f5f9, Mesenzio, MOB2 e 1 altro utente piace questo messaggio.
  8. Alice 0.8

    Alice 0.8 Livello 1

    Messaggi:
    430
    Mi piace:
    1.119
    Yeah baby, eccoci a un nuovo episodio sugli artifici immaginografici!:emoji_metal:
    Lo so che siete stanchi di 'sta roba però ormai ho deciso di segnalare le novità salienti e quindi presentiamo i due ospiti della serata. Sarà uno scontro tra i creatori di TikTok contro quelli di Facebook. Roba da socialari anziché da socialisti ma i bei tempi di Mao d'altronde son finiti da un pezzo.
    Ospite numero 1: Seedream 5 Pro. Tanto atteso dai cinesi come l'unico che potrebbe avere le carte in regola per giocarsela con Google e GPT immagini, ma ci riuscirà?
    Bytedance questo mese è foriera di novità: ha rilasciato Seedance 2.5 confermandosi leader dei generatori video e poi Seed-audio, che emula le voci umane in modo notevole ed è uno pochi tool che si possono davvero prendere in considerazione per il doppiaggio in mancanza di doppiatori umani disponibili. Con questo sono riuscita a ingannare mia madre facendogli sentire la mia voce clonata per telefono e lei era convinta che fossi realmente io. Quando gli ho rivelato lo scherzo, spiegandogli che si trattava di un test, lei mi ha insultata dicendo che questa IA mi sta facendo diventare pazza. Avrà ragione? Solo lo Stregatto conosce la risposta...
    Ma qui parliamo di immagini quindi ciancio alla bande.
    Ospite numero 2: Muse image. E' il nuovo generatore immagini di Meta... no, non vomitate subito perché vi anticipo che stavolta non fa schifo. Finora l'industria AI di Meta è stata una vera e propria fabbrica di liquame digitale ma evidentemente Zuckerberg, a furia di comprarsi teste d'uovo di un certo calibro sta finalmente facendo funzionare la baracca. Muse di interessante ha che vi mostra i suoi ragionamenti in corso d'opera e le successive rielaborazioni che intraprende per migliorare la qualità finale. Il fatto è che, quando ci riflette sopra, anziché migliorare l'output lo peggiora però vi mette a disposizione la cronologia dei processi e quindi potete scegliere il risultato meglio riuscito.
    Per Seedream 5 ho avuto difficoltà a racimolare sufficienti crediti free e quindi andiamo con quel poco che ho tirato su.

    Scena 1: Concept art Sci-fi.
    [​IMG]
    [​IMG]

    La statua è okay ma l'astronauta è venuta orrenda: il volto sotto il casco pare liquefatto e tutto il senso dell'immagine consiste nel contrasto tra la piccineria umana e la grande statua ancestrale, quindi niente... bocciato.
    [​IMG]

    Muse ha fatto meglio quindi vince il primo round.

    Scena 2: antiche rovine in acquerello.
    [​IMG]
    [​IMG]
    Come senso di composizione generale va bene ma i soggetti principali sono po' bruttini perché scala male il dettaglio delle forme complesse distanti. E' un difetto comune a quasi tutti i modelli, e infatti ne ho parlato spesso, ma nel nuovo Seedream è perfino più accentuato del solito.
    [​IMG]
    E' forse più bello di quello di Banana. Quindi Facebook 2 TikTok 0.

    Scena 3: Teddy forever
    [​IMG]
    [​IMG]
    Cioè, ma che schifo è questa roba? L'errore delle mani è madornale e pure i piedi della tizia sembrano fusi col terreno. Gli do una seconda possibilità per redimersi perché sto diventando troppo tenera.
    [​IMG]
    Vabbè, almeno ora è accettabile.
    [​IMG]
    Pure qui preferisco Muse. Quindi sta 3 a zero.

    Scena 4: posa d'azione dinamica con reference
    [​IMG]

    [​IMG]
    E qui già va meglio. Peraltro è un tipo di posa difficile dove molti modelli combinano castronerie. C'è qualche leggero artefatto nelle mani e i piedi però.
    [​IMG]
    L'output non mi dispiace ma Muse non mi fa usare reference per qualche bega legale del piffero e quindi la qualità della sua character consistency non mi è pervenuta.

    Scena 5: la fabbricante di maschere.
    [​IMG]

    [​IMG]
    Questa non è troppo male anche se il retro della maschera che la donna tiene in mano è definito in maniera poco comprensibile nonostante sia l'elemento focale della scena.
    [​IMG]
    Anche in questo round preferisco Muse a Seedream. Tuttavia è un ottimo esempio per denotare la sua minore intelligenza rispetto a GPT: la donna qui pare stia dipingendo la maschera a casaccio tanto per cominciare.

    Scena 6: magia del fuoco per principianti.
    [​IMG]

    [​IMG]
    Non ci sono errori ma è piuttosto inespressiva rispetto alla vecchia versione di GPT.
    [​IMG]
    Stesso discorso di prima per la character consistency non permessa. Però il risultato è abbastanza okay. Ad essere pignoli c'è un artefatto nel tessuto dello scollo a goccia ma poca roba.

    Giudizio su Seedream 5.0 Pro:
    Visto quanto era avanti al tempo Seedream 4 era lecito aspettarsi di più da un colosso del calibro di Bytedance. A livello estetico non è granché migliorato e anzi, produce talvolta risultati peggiori. I miglioramenti presenti in Seedream 5 si concentrano sul controllo del risultato: è stato aggiunto un editing con precisione regionale e la separazione dei livelli (anche Reve ha qualcosa di simile). Inoltre adesso possiede integrato un testo multilingue nativo e permette la generazione di infografiche ad alta densità. Lo scopo è sempre quello di offrire un prodotto solido per la produzione seriale di infografiche, advertising, design, ecc... insomma, si sta specializzando sulle applicazioni commerciali a discapito del resto.
    Andiamo con la pagellina e bon.
    Pro:
    - Editor assai versatile.
    - Character consistency migliorata.
    - Gli output sono tarati come frame di base per animarli con Seedance.
    - Potendo esportare i livelli singolarmente può essere interessante in combinazione con Photoshop.
    Cosa non mi ha convinto:
    - E' lungi dall'essere esente da artefatti; anche se ha più personalità rispetto a un Qwen Pro, entrambi fanno la figura delle Banane dei poveri.
    - Le immagini in sé hanno poco pathos e si potrebbe compensare animandole ma costa farlo.
    - Scala piuttosto male i dettagli, soprattutto i volti, quando deve ritrarre soggetti distanti.
    - La risoluzione massima è di 'soli' 2k contro i 4k di Banana, GPT e del precedente Seedream 4.

    Giudizio su Muse image:
    Muse invece mi ha sorpreso positivamente come composizione, comprensione delle istruzioni e resa estetica. Mi aspettavo l'ennesimo modello idiota per socialari e invece è uno dei pochi che non sfigura a fianco di Gemini e GPT immagini.
    Pagellina.
    Pro:
    - E' buono.
    - Rielabora le immagini finché non è soddisfatto della resa finale e poi dalla cronologia dei processi potete scegliere la versione che più vi aggrada.
    - Capisce le istruzioni bene quanto Banana.
    - Potete crearci 25 immagini gratis al giorno e non è poco di questi tempi dove tutto sta finendo sotto paywall.
    Cosa non va:
    - Non ti fa usare reference per timore che trasformi tua suocera nella regina dei pirati.
    - Quando continua a elaborare un output per migliorarlo talvolta lo peggiora.

    Top 5:
    1) La Banana Imperatore (fra tre mesi compie un anno eppure nessuno è riuscito a scalzarla)
    2) Gippittì (Molto artefatto ma con una comprensione della prospettiva ideale che fa impallidire pure Google).
    3) Muse image (Zucky ha dovuto sacrificare molti dipendenti a Moloch ma alla fine la sua azienda è riuscita a creare un modello serio).
    4) Ideogram 4 (Tiene in alto il vessillo dell'Open Source in attesa di Flux 3).
    5) Uni 1.1 max (La molto sottovalutata e strana creatura di Luma. E' anche scarsamente reperibile però senza acquistare chiavi API, ragion per cui è apparsa poco e niente su questa rubrica).

    Alla prossima orsacchiotti!:emoji_bear: Che l'acqua Prata sia con voi.
     
    A f5f9, MOB2 e alaris piace questo messaggio.
  9. alaris

    alaris Supporter

    Messaggi:
    9.313
    Mi piace:
    5.166
    Personalmente Muse in queste immagini batte tutti...parere
     
    A Alice 0.8 piace questo elemento.
  10. Alice 0.8

    Alice 0.8 Livello 1

    Messaggi:
    430
    Mi piace:
    1.119
    Parere legittimo. Di sicuro Muse per me è stata una vera sorpresa: il modo in cui valuta la maniera più opportuna di procedere e rifinire è molto interessante e sofisticato.
    Se non è il migliore quantomeno se la gioca alla pari con Google e OpenAi, cosa in cui finora tutti gli altri hanno fallito.
    I tre modelli condividono l'idea di fondo di 'pensare prima di generare', ma affrontano il problema con architetture e filosofie diverse.
    GPT Image 2 ragiona come un pianificatore interno che scompone e verifica il prompt (fa anche ricerche web se gli servono riferimenti). E' una logica da “copilota creativo” più che da puro renderer ed è questo che lo ha reso il modello più amato, perché viene incontro a chi ha idee vaghe o non sa promptare.
    Metaforicamente somiglia a una segretaria metodica che ordina e pianifica il contenuto delle vostre istruzioni prima di passarle all'esecuzione grafica.
    Nano Banana Pro ragiona come un enciclopedista visivo che sfrutta la conoscenza di Gemini 3 per rendere l'immagine fattualmente coerente. Ciò lo rende un modello multimodale molto competente che capisce vincoli complessi e li traduce in un layout controllato ma funziona meglio per chi ha idee precise e sa essere accurato in ciò che vuole.
    Metaforicamente somiglia a un regista che usa le sue conoscenze per dar forma alla vostra sceneggiatura.
    Muse Image ragiona come un agente iterativo che chiama strumenti esterni, guarda il proprio output e lo corregge in un loop. Praticamente agisce come un agente autonomo: prima il modello (se occorre) cerca sul web dati visivi e poi compila del codice per garantire che i layout siano accurati dal punto di vista matematico e contestuale.
    Metaforicamente somiglia a un vostro scagnozzo che si documenta ricorrendo a numerosi tool prima di procedere, poi passa il progetto all'esecuzione grafica e dopo verifica se il risultato corrisponde alle aspettative (quest'ultimo passaggio anche GPT lo fa ma poi gli svarioni li combina comunque).
     
    Ultima modifica: 11 Luglio 2026
    A MOB2 e alaris piace questo messaggio.
  11. Alice 0.8

    Alice 0.8 Livello 1

    Messaggi:
    430
    Mi piace:
    1.119
    Ecco un nuovo post non richiesto di immaginosità artificiosa.:emoji_sunglasses:
    L'ospite della serata è Qwen image 3.
    Rilasciato piuttosto in sordina, in giro l'ho trovato solo sul sito ufficiale della famiglia Qwen di proprietà del colosso dell'e-commerce Alibaba che offre un discreto numero di generazioni gratuite al giorno.
    Qwen, il cui nome integrale sarebbe Tongyi Qianwen (ovvero 'comprendere e rispondere a mille domande') ha fatto progressi costanti ed è attualmente un modello molto versatile che personalmente utilizzo per risolvere problemi matematici e analizzare file multimediali (tipo trascrivere clip di audio in lingua straniera che non riesco a capire e cose simili). Come creatore di immagini fino ad un anno fa era penoso ma dalla versione 2 ha cominciato ad evolvere raggiungendo la decenza nella sua versione Pro. Come ho già detto nelle prove passate, per il gusto e la cultura di noi occidentali ha la tipica caratteristica dei modelli cinesi che sono addestrati su dataset prevalentemente asiatici e questo talvolta si riflette sull'estetica e le espressioni dei personaggi che generano.
    Il suo avversario sarà Muse e includiamo anche Uni per chi preferisce bere fuori dal coro.

    La giungla perduta
    Qui le AI devono solo disporre fedelmente gli elementi del prompt e contare correttamente il numero di scimmie. Un tempo combinavano disastri nel farlo ma ormai qualsiasi modello anche solo passabile ci riesce.
    [​IMG]
    [​IMG]
    [​IMG]
    [​IMG]
    Se vogliamo essere pignoli Qwen ha sbagliato la coda di una scimmia facendola doppia ma si nota poco e non è un errore grave. La sua immagine ha dei bei colori.

    La terra degli uomini gufo

    Questa è una scena a inchiostri non facile perché deve trasmettere un senso di incombenza, di pericolo e al contempo empatia tra i protagonisti. Anche la prospettiva per funzionare esige dal modello una comprensione dell'insieme.
    [​IMG]
    [​IMG]
    [​IMG]
    [​IMG]
    Uni lasciamolo perdere. Comunque esteticamente sa essere 'originale' in particolar modo per come ha rappresentato la maga: voleva fare un frocio e non ci ha pensato due volte. Questo è lo spirito giusto.
    Qwen è stato il peggiore. La scena è affettata e i protagonisti appaiono dissociati dalla minaccia degli uomini gufo. Come se non bastasse il gufo al centro compenetra con quello alla sua destra.

    Foto vintage
    In teoria è una scena semplice in cui è richiesto di emulare le vecchie fotografie in bianco e nero eppure il fatto che i personaggi condividano un unico frappè manda in confusione alcuni modelli.
    [​IMG]
    [​IMG]
    [​IMG]
    [​IMG]
    Banana se insisto a metterlo primo in classifica qualche ragione c'è.
    Si nota poco ma Muse ha fatto un errore col pollice della donna. Siccome c'era la cannuccia di mezzo non poteva generare il dito come un unicum e dividendolo in due segmenti ne ha sbagliato la simmetria. E' un errore tipicissimo di questi software. Lo fa pure GPT all'occorrenza.
    Qwen... Madò! Cioè, ha fuso le braccia dell'uomo. Una schifezza che nemmeno in Flux 1 mi capitava.

    Ritratto pittorico
    Proviamo infine come di consueto la character consistency (che è fondamentale se usate l'AI per lo storytelling). L'immagine è abbastanza semplice ma è richiesto comunque senso estetico.
    [​IMG]
    [​IMG]
    [​IMG]
    [​IMG]
    Contrariamente alla prima volta che l'ho provato adesso i reference su Muse funzionano.
    Qwen... soprassedendo su quel supporto di legno innaturale che si è inventato per qualche arcana ragione l'immagine come espressività sarebbe stata anche buona se non avesse fatto piede e mano destra deformi. Il piede per di più compenetra col legno. Si vede che ha grossi limiti a gestire gli spazi.

    Andiamo con la pagellina di Qwen e bocciamo questo ragazzo cinese che è bravo ma non si applica.

    Lati positivi:
    E' accurato nel capire le istruzioni di testo e supporta prompt anche molto lunghi.
    E' migliorato in tutto rispetto alla versione 2, in particolar modo nel rendering delle luci.
    Risoluzione di base 2K
    Lati negativi:
    E' ultra-censurato e ho dovuto scartare quasi tutti i prompt che avevo preparato per questo post.
    E' molto lento a generare.
    Fa gravi errori con gli arti praticamente due volte su tre rendendo buona parte degli output inutilizzabili.

    Giudizio conclusivo:
    L'ho trovato decisamente inferiore a GPT, Muse e Banana. Manipoli di youtuber fuffari al solito sono usciti dalle loro tane e hanno pubblicato video dove dicono che Qwen image 3 spacca il mondo ma non è vero. Malgrado la sua buona resa estetica combina pasticci anche nei task più semplici e si vede che è stato scarsamente testato e ottimizzato prima di lanciarlo. Per ora i cinesi continuano sensibilmente a perdere il confronto con gli americani nel campo delle immagini.

    Già che ci siamo un giudizio breve su Uni: alla Luma non hanno filtrato ruffianamente i training data e quindi è oggi uno dei rari modelli che sforna anche donne e uomini brutti eludendo dall'iper standardizzazione estetica degli altri generatori di immagini. Anche negli stili artistici se ne frega di essere piacione e quindi è una delle poche opzioni valide se volete qualcosa di non stereotipato, strano o inconsueto. Ha moltissimi difetti e io l'ho inserito in classifica più per provocazione che altro ma nelle immagini realistiche talvolta se la cava meglio di modelli più gettonati.

    La classifica resta invariata, quindi ciauz!:emoji_clap:
     
    A f5f9, Mesenzio, alaris e 1 altro utente piace questo messaggio.
  12. f5f9

    f5f9 si sta stirando Ex staff

    Messaggi:
    21.631
    Mi piace:
    10.283
    ma sempre istruttivo
     
    A alaris piace questo elemento.
  13. Alice 0.8

    Alice 0.8 Livello 1

    Messaggi:
    430
    Mi piace:
    1.119
    Boom! :emoji_boom: È arrivato Grok imagine 2, autoproclamatosi il migliore generatore al mondo dopo Gippittì... ma sarà vero? Ormai lo sapete che me ne infischio dell'hype e visto che Elon a questo giro è perfino più pretenzioso del solito, dare al suo modello almeno un prompt difficile sarà più che doveroso.
    Usarlo gratis senza essere iscritti a X è possibile sul sito Grok.com ma si hanno a disposizione solo due generazioni risicate al giorno prima che parta la schermata del paywall. Come avversario ho scelto Seedream 5, il quale, lungi dall'essere il numero 2 al mondo, dovrebbe venire surclassato dalla magnificenza della nuova creatura di Musk... o no?

    Creature misteriose
    Cominciamo con una scena ad acquerello e inchiostro. La mano del mostro va raffigurata come se stesse scendendo dalla sommità del camino e questo richiede al modello una comprensione dell'ambiente rafforzata dal fatto che la streghetta deve effettivamente indicare il panino.
    [​IMG]
    [​IMG]
    [​IMG]
    Malgrado non mi piace come la mano esce dal camino l'immagine di Seedream è passabile e il modo in cui la strega cerca di attirare l'attenzione del ragazzo assorto nella lettura per mostrargli il furto di panino in corso è rappresentata correttamente.
    Quella di Grok invece lascia molto a desiderare sia nello stile grafico col solito oversharpening colloso (che ricorda tanto il peggiore GPT), sia nella rappresentazione della scena con la ragazza che indica un punto senza senso.
    Per la cronaca posto l'immagine realizzata con la vecchia versione di Grok che pur contenendo errori vari e non essendo nulla di che, risulta comunque preferibile alla schifezza del Grok nuovo.
    [​IMG]
    Incubus
    Vediamo ora una scena gotica in acquatinta e acquaforte.
    [​IMG]
    [​IMG]
    [​IMG]
    Le immagini di Banana e Seedream colgono l'idea di una donna inerte direttamente osservata con bramosia da un demone dei sogni che sembra materializzarsi dall'oscurità. Invece quella di Grok è scadente e sterile: ha semplicemente spalmato un mostro che guarda nel vuoto.

    La Rusalka
    Questo è un prompt abbastanza difficile per l'AI perché deve concepire la Rusalka (un demone dei fiumi della mitologia slava) umana in superficie e scheletrica sotto l'acqua. Il fatto è che molti modelli non sanno scindere la figura umana (o gli oggetti) con coerenza e realizzano semplicemente uno scheletro in basso e una donna in alto senza nessuna continuità come fossero due figure distinte e separate.
    [​IMG]
    [​IMG]
    [​IMG]
    Aldilà dei difetti nella mano che accarezza l'uomo Seedream è riuscito a rappresentare la transizione della parte del corpo scheletrica con quella fatta di carne in modo accettabile mentre Grok, passi la sua estetica plasticosa, ha fatto un pastrocchio inguardabile.

    Gas Station
    Chiudiamo col tipo di scene sexy per cui Grok in origine è stato inventato (non che abbia mai saputo farle, beninteso, anche perché la sua character consistency è sempre stata scadente).
    Comunque l'acqua deve cadere sulla donna e bagnarla con un minimo di coerenza e i generatori di immagini in generale non sono per niente bravi a rappresentare realisticamente le dinamiche dei fluidi.
    [​IMG]
    [​IMG]
    [​IMG]
    In verità qui sbagliano tutti a rappresentare la donna bagnata ma al solito Grok è il più sgradevole e grossolano da guardare: il braccio sinistro della donna in cui l'acqua neanche ci è andata è tutto bagnato mentre la canottiera sta perfettamente asciutta.

    Bene... congratulazioni Grok. Sei stato di gran lunga il peggiore.
    Ne ho visti di modelli overhyped ma questo merita un premio speciale dal momento che è addirittura un downgrade rispetto alla vecchia versione. Unisce assieme la peggiore plasticità di GPT con la dissociazione di Flux. Molti danno la colpa al fatto che Grok è diventato AI agent-based ma pure Muse Spark lo è, eppure non risulta così imbarazzante negli output. La verità è che Musk e il suo team si fanno di robaccia. Ennesima riprova di come le classifiche dei siti di benchmark siano totalmente falsate, frutto di manipolazione di marketing e ottimizzazione apposita su prompt specifici per ottenere un punteggio più alto malgrado l'insoddisfacente qualità complessiva del modello.

    Okay, per ora vi saluto, orsi belli.
     
    Ultima modifica: 13 Agosto 2026
    A f5f9, alaris e MOB2 piace questo messaggio.
  14. alaris

    alaris Supporter

    Messaggi:
    9.313
    Mi piace:
    5.166
    Sempre tutto molto interessante, grazie per i tuoi interventi sull'argomento...
     
  15. Alice 0.8

    Alice 0.8 Livello 1

    Messaggi:
    430
    Mi piace:
    1.119
    Ma grazie a te, Alaris!
    A quanto pare molte delle immagini che avevo caricato nel mio ultimo post sono già sparite dall'host per qualche arcana ragione. Se non si tratta di un problema provvisorio provvederò a ricaricarle.
    Nel frattempo rispondiamo alle domande più comuni che nessuno ha fatto:
    1. Perché Midjourney non è mai stato ospite di questo show?
    Perché è un pezzo da museo che trovo inutilizzabile. C'è stato un tempo, all'uscita della versione 4, in cui Midjourney era il generatore per antonomasia ma da allora praticamente non è mai evoluto nella gestione dei prompt e quindi, nonostante sia giunto alla V8, resta incapace di processare qualsiasi istruzione minimamente elaborata e commette errori madornali in qualsiasi cosa che vada oltre i ritratti e i landscape. E' certamente valido per miscelare stili ed elementi artistici perché sviluppato in stretta collaborazione coi disegnatori umani, ma in pratica non sa realizzare con successo niente di quello che mostro in questo topic.
    Volete un esempio?
    [​IMG]
    [​IMG]
    Cioè, sembra di tornare ai tempi di Stable diffusion 1.5 a livello di comprensione e capacità su quello che gli dici di fare.

    2. Quali sono i generatori meno censurati utilizzabili online?
    Quelli basati sul cloud sono quasi tutti censurati perché le piattaforme non vogliono problemi legali: troppa gente brama di trasformare le ragazze che conosce in barbie zoccole come è accaduto nella piattaforma di Musk quando Grok era abbastanza permissivo. Se la gente tenesse per sé le proprie intime fantasie senza la smania della condivisione di massa il problema non sussisterebbe ma è come dire che se i porci volassero il prosciutto arriverebbe dappertutto senza bisogno dei camion.
    C'è da dire che molti filtri sono overstretched a livelli demenziali e impediscono di generare scene normalissime pensate per crime stories, drammi sentimentali, racconti d'azione, ecc... Tutte cose che vengono rappresentate dalla notte dei tempi ma ora cadono sotto la sigla NSFW (Not Safe for Work).
    Si possono fare scene più erotiche e violente coi generatori video che con quelli di immagini. Ad esempio Seedance 2.5 permette scene d'azione con violenza molto esplicita e il misconosciuto Unlucid non si fa problemi a generare anche video di nudi integrali. La maggior parte dei software quando gli dai in pasto figure di riferimento replicano il volto ma inventano il corpo, tuttavia certi risultati possono comunque risultare lesivi alla dignità personale. Come attenuante al momento bisogna sottolineare che i modelli sufficientemente realistici da ingannare davvero sono pochi e non open source. Esistono anche AI tarate apposta per i porno ma senza bisogno di andare a verificare sono certa che i risultati siano estremamente artificiosi e inverosimili (face-swapping su animazioni precostruite e roba del genere).

    Comunque di poco censurati per le immagini abbiamo Kling O3, sebbene non sia una cima. Anche Krea 2 è abbastanza accomodante. Reve mi è parso meno scassaballe di altri, tuttavia non brilla per realismo. Banana un minimo di tolleranza ce l'ha.
    Tra quelli censurati oltre il ridicolo invece ci sono Muse, MAI, Qwen 3 e Adobe Firefly.

    3. Cosa ne pensi di Recraft V4?
    Non vale particolarmente come generatore di immagini puro; sa realizzare dei soggetti in posa con sufficiente realismo anche se con le dita di mani e piedi ce la fa a stento. Resta pensato prevalentemente per l'industria del design: loghi, icone, arte vettoriale, ecc...
    Per esempio già una scena a due spesso è incapace di gestirla correttamente senza deformare le mani.
    [​IMG]
    [​IMG]
    4. Cosa ne pensi di Krea 2?
    Non è tanto censurato ed è uno dei pochi modelli che permette di realizzare scenette con personaggi famosi del cinema e i videogiochi che vengono solitamente bloccate aggressivamente dai filtri per ragioni di copyright.
    In genere viene usato dagli utenti per creare cavolate tipo questa:
    [​IMG]
    Non ha grandi capacità, intendiamoci, ma quantomeno ha un aderenza e una comprensione dei prompt accettabili.

    Bene. Penso di poter concludere con la posta del cuore.
     
    Ultima modifica: 13 Agosto 2026
    A f5f9, Mesenzio, MOB2 e 1 altro utente piace questo messaggio.
  16. f5f9

    f5f9 si sta stirando Ex staff

    Messaggi:
    21.631
    Mi piace:
    10.283
    mooooooooolto interessante
    ma troppe immagini mi dicono "non found" :emoji_disappointed:
     
  17. Alice 0.8

    Alice 0.8 Livello 1

    Messaggi:
    430
    Mi piace:
    1.119
    Strano perché proprio ieri ho perso tempo apposta a fare il re-up di quelle che nell'host si erano cancellate (forse per problemi al server). Ora aprendo la pagina del topic, almeno sul mio browser, si vedono di nuovo tutte.
     
  18. alaris

    alaris Supporter

    Messaggi:
    9.313
    Mi piace:
    5.166
    L'altro giorno le vedevo tutte adesso anche per me not found
     
  19. Alice 0.8

    Alice 0.8 Livello 1

    Messaggi:
    430
    Mi piace:
    1.119
    ImgBB finora si era dimostrato abbastanza affidabile e mi pare strano che da me si vedono e voi no. Comunque visto che continuate a segnalare problemi le ho ricaricate tutte su un nuovo host confidando d'aver risolto.:emoji_fingers_crossed:
     
    A alaris piace questo elemento.
  20. alaris

    alaris Supporter

    Messaggi:
    9.313
    Mi piace:
    5.166
    Grazie risolto!
     
    A Alice 0.8 piace questo elemento.