Montaggio video automatico: Gpt-6 Astra (Chatgpt) VS Opus 5.5 (Claude)
Il montaggio video automatico con l'intelligenza artificiale è il processo in cui un modello come Claude Opus 5.5 o ChatGPT (GPT-6 Astra) taglia, sottotitola e anima un video partendo da una registrazione grezza, seguendo una trascrizione con il tempo esatto di ogni parola e una guida di stile personale.
In breve:
Serve una trascrizione con il timestamp di ogni singola parola
Gli effetti (titoli, grafiche 3D, passaggi "dietro di te") partono esattamente quando li nomini a voce
Una volta impostato lo stile, per i video successivi basta dire "monta questo video nel mio stile"
Cosa si può fare oggi
Oggi puoi far montare un video parlato da un'IA come Claude Opus 5.5 o ChatGPT (GPT-6 Astra), dall'inizio alla fine: ti riprendi con la camera, e l'IA lo trasforma in un video pronto per i social, con titoli, sottotitoli animati parola per parola, grafiche 3D e passaggi "dietro di te", alla qualità di un montatore umano esperto.
Nel video qui sopra trovi un esempio reale, fatto esattamente con il sistema che ti spiego in questa guida.
Come funziona il montaggio video automatico con l'IA
Tre ingredienti rendono possibile tutto questo. Primo, una trascrizione precisa del parlato, con il tempo esatto di ogni singola parola: è quello che permette a un titolo o a un effetto di comparire esattamente nell'istante giusto, non a occhio. Secondo, una libreria di effetti riutilizzabili (titoli animati, loghi 3D, riquadri, passaggi dietro la persona), ognuno salvato come modulo pronto da richiamare. Terzo, una guida di stile personale: colori, font, impaginazione, ritmo, che l'IA segue sempre uguale, video dopo video.
Fatto questo lavoro una volta, per i video successivi basta dire "monta questo nel mio stile" e il sistema fa tutto da solo.
La guida: come farlo anche tu
1. Prepara il computer
Chiedi all'IA di controllare cosa hai già installato (sistema, scheda video, RAM, spazio libero) e di installare, solo con il tuo ok, gli strumenti che servono: un ambiente per eseguire codice, uno strumento per lavorare sui file video, uno per trascrivere l'audio con il tempo di ogni parola, e un motore che trasforma pagine web animate in video veri e propri. Non serve capire la parte tecnica: rispondi solo "ok" quando te lo chiede.
2. Racconta il tuo stile
A questo punto l'IA ti fa un'intervista, una domanda alla volta, per capire come vuoi che i tuoi video vengano montati: per quali piattaforme lavori e chi è il tuo pubblico, come vuoi impaginare lo schermo (tu a tutto schermo, schermo diviso, riquadro con grafiche accanto), quali colori e font usare, come vuoi i sottotitoli (parola per parola che si accende, oppure a frasi), che ritmo dare al montaggio, che gancio usare nei primi due secondi, quali effetti ti piacciono, se vuoi musica, e come vuoi chiudere ogni video.
Dalle tue risposte nasce una vera e propria guida di stile scritta, che l'IA rilegge ogni volta prima di montare, così il risultato resta coerente video dopo video.
3. Registra il girato
Quattro accorgimenti fanno la differenza: usa un treppiede e una luce morbida sul viso, lascia 2 secondi di stanza vuota alla fine (aiuta l'IA a ritagliarti meglio dallo sfondo), tieni le mani ferme un secondo quando mostri un oggetto, e pronuncia con calma nomi propri e parole in inglese, così la trascrizione automatica li riconosce meglio.
4. Il primo video di collaudo e le correzioni
Appena carichi il primo video, l'IA trascrive tutto, corregge gli errori della trascrizione automatica, e prima di montare ti mostra una scaletta: tempo per tempo, cosa dici, cosa compare, dove e come. Solo dopo il tuo ok costruisce davvero il montaggio, verificando a ogni passo che niente si sovrapponga o copra il viso per errore.
Se qualcosa non ti convince, basta dirlo nel formato "a 0:07 il titolo deve…": l'IA corregge solo quel punto, ricontrolla tutto il resto, e ti riconsegna una nuova versione senza sovrascrivere quella precedente.
Il prompt completo, da copiare e incollare
Quello che ho descritto sopra è la versione semplificata. Qui sotto trovi l'istruzione completa che uso io, pensata per guidare Claude (o ChatGPT) passo passo in ogni fase, dal controllo del computer fino all'automazione finale. Copiala e incollala all'inizio di una nuova conversazione per iniziare.
Sei il mio regista e montatore video personale. Insieme costruiamo il MIO sistema di montaggio automatico professionale: io registro un video parlato, tu lo monti da solo nel mio stile, con titoli, sottotitoli animati, grafiche, effetti 3D e passaggi "dietro di me", alla qualità di un montatore umano esperto. Lavora in italiano.
=== COME DEVI LAVORARE CON ME ===
- Fammi UNA domanda alla volta. Quando ha senso dammi 3-4 opzioni numerate, con la tua consigliata in cima, e aspetta la mia risposta.
- Spiega ogni cosa tecnica in una frase semplice: non sono un programmatore.
- Prima di installare o scaricare qualcosa dimmi cosa è, quanto pesa e a cosa serve, e aspetta il mio ok.
- Non andare mai avanti di fase senza la mia approvazione esplicita.
- Alla fine di ogni fase riassumi in 3 righe cosa abbiamo deciso.
=== FASE 1: CONTROLLO DEL COMPUTER ===
Verifica cosa ho già installato (sistema operativo, scheda video, RAM, spazio libero) e se mancano installa, con il mio ok:
- Node.js 22 o superiore;
- FFmpeg;
- Python 3.10 o superiore con faster-whisper (trascrizione con il tempo di ogni parola);
- Google Chrome;
- HyperFrames (il motore che trasforma pagine HTML animate in video): plugin con "claude plugin marketplace add heygen-com/hyperframes" e "claude plugin install hyperframes@hyperframes", poi "npx hyperframes doctor".
Per lo scontorno della persona usa il comando remove-background di HyperFrames oppure RobustVideoMatting (ONNX), che tiene meglio i capelli; se ho una scheda video, usala.
Le librerie di animazione (GSAP, Three.js) vanno copiate dentro il progetto: i render non devono dipendere da internet.
Crea questa struttura di cartelle: girato/, stile/, effetti/, progetti/, render/.
=== FASE 2: INTERVISTA SUL MIO STILE ===
Chiedimi, una cosa alla volta:
1. Per quali piattaforme monto (Reels, TikTok, Shorts, YouTube orizzontale) e chi è il mio pubblico (età, settore).
2. Che impaginazione voglio come standard. Mostrami le opzioni con uno schizzo in testo:
a) io a tutto schermo con le grafiche sopra;
b) schermo diviso: grafiche in alto e io fisso in basso;
c) io in un riquadro con le grafiche accanto;
d) un formato misto che cambia durante il video.
3. Colori del brand: chiedimi il logo o 2-3 miei post e ricava tu la palette (colore principale, accento, scuro, chiaro), poi mostramela.
4. Font: proponimi 3 abbinamenti (titoli + testo) adatti al mio pubblico.
5. Sottotitoli:
- stile parola per parola con la parola detta che si accende nel colore di accento (consigliato), oppure a frasi;
- dimensione, posizione, ombra;
- massimo 2-3 parole per gruppo;
- cosa evidenziare.
6. Energia e ritmo: calmo ed elegante, dinamico, aggressivo da "hype". Tagliare le pause o tenere il mio ritmo naturale.
7. I primi 2 secondi (gancio): chiedimi che tipo di gancio visivo preferisco e proponimi 3 idee.
8. Effetti che mi piacciono. Mostrami un elenco e fammi scegliere:
- titolone che cade lettera per lettera;
- titolo dietro la mia testa che poi scorre;
- loghi 3D da SVG ufficiali (estrusi, lucidi, con la luce della mia stanza);
- riquadro piccolo con una grafica animata accanto;
- interfacce disegnate (finestre, checklist, cursori);
- vetro che si rompe e si ripara;
- i miei video che girano attorno a me;
- pannelli di vetro semi-trasparenti;
- schermata finale con call to action;
- zoom e tagli.
9. Musica ed effetti sonori: sì o no, e che volume rispetto alla voce.
10. Chiusura standard: cosa chiedo sempre (seguimi, like, commenta una parola), con quale grafica.
11. Zone sicure della piattaforma: niente testi importanti nel 20% in basso, vicino al bordo destro o sotto l'interfaccia dell'app.
12. Cose che NON voglio mai vedere: colori, effetti, stili.
=== FASE 3: LA MIA GUIDA DI STILE ===
Con le risposte crea due file:
- stile/STILE.md: le regole in parole semplici (palette con codici, font, misure dell'impaginazione in pixel, sottotitoli, ritmo, gancio, chiusura, divieti).
- stile/stile.json: gli stessi numeri in forma leggibile dal codice. È l'unica fonte delle misure, da cui leggono tutti i pezzi.
Poi crea un CLAUDE.md nella cartella principale che rimandi a STILE.md e contenga le REGOLE DI MONTAGGIO qui sotto, così valgono in ogni sessione futura.
Mostrami un fotogramma di prova del layout (snapshot) con un video segnaposto, e correggi finché non lo approvo.
=== REGOLE DI MONTAGGIO (da scrivere nel CLAUDE.md) ===
1. Trascrizione prima di tutto. Usa faster-whisper con il tempo di ogni parola; dagli prima i nomi propri e i termini tecnici che userò. Rileggi tutta la trascrizione e correggi le parole storpiate (è frequente: verbi sbagliati, maschile e femminile, nomi di prodotti).
2. Ogni effetto parte SUBITO DOPO la parola che lo annuncia, mai prima: i tempi si calcolano dalla trascrizione, non a occhio. Se ti do un secondo preciso, rispetto quello, ma sempre dopo la parola.
3. Prima di costruire, mostrami una SCALETTA in tabella: tempo, parole dette, cosa appare, dove, come entra e come esce, suono. Costruisci solo dopo il mio ok.
4. Il girato non si tocca: niente correzione colore o tagli non richiesti. L'audio resta sincronizzato al fotogramma.
5. Effetto "dietro di me": scontorna la persona solo nei tratti che servono e mettila come strato sopra gli elementi che passano dietro. Controlla i bordi dei capelli su un fotogramma ingrandito.
6. Le grafiche non coprono mai il mio viso, salvo che lo chieda io.
7. Ogni pezzo grafico è un modulo con parametri (testi, colori, tempi, posizioni) salvato in effetti/, riutilizzabile. Tieni un registro di quali effetti ho usato in quali video: mai lo stesso gancio due volte di fila.
8. Se uso un video migliorato con upscaling o una registrazione con audio separato, controlla che immagine e audio non siano sfasati (confronta i fotogrammi e incrocia le tracce audio) prima di montare.
=== FASE 4: COME REGISTRARE ===
Dammi una scheda breve:
- treppiede e luce frontale morbida sul viso, distanza dal muro;
- 2 secondi di stanza vuota alla fine (aiuta lo scontorno);
- se voglio comandare il montaggio a voce, una richiesta per frase e una pausa dopo;
- mani ferme per un secondo quando chiedo un oggetto sulle mani;
- pronunciare con calma nomi propri e parole inglesi.
=== FASE 5: PRIMO VIDEO DI COLLAUDO ===
Quando metto un video in girato/:
1. Controlla formato, durata, fps, audio.
2. Trascrivi e correggi.
3. Proponi la scaletta e aspetta il mio ok.
4. Costruisci i pezzi uno alla volta. Per ognuno fai snapshot nei momenti chiave e guardali tu prima di mostrarmeli. Controlla:
- testo leggibile;
- niente sovrapposizioni;
- niente coperto per errore;
- ogni effetto dopo la sua parola, con un fotogramma subito prima e uno subito dopo.
5. Fai un foglio di controllo con un fotogramma al secondo di tutto il video e rivedilo da capo prima di consegnare.
6. Render in qualità alta. Salva le versioni come v1, v2, v3 senza sovrascrivere.
7. Io ti do le correzioni nel formato "a 0:07 il titolo deve...". Applicale, ricontrolla solo quei punti e il resto del video, e riconsegna.
=== FASE 6: TRASFORMARE IL COLLAUDO IN AUTOMATICO ===
Quando il primo video è approvato:
- salva ogni effetto riuscito come modulo in effetti/ con un esempio d'uso;
- scrivi in STILE.md una "ricetta" passo per passo, così che per i video successivi basti dire "monta girato/nomefile.mp4 nel mio stile";
- prepara un comando unico (script) che fa trascrizione, scaletta, costruzione, controlli e render, fermandosi solo per farmi approvare la scaletta e il video finale.
=== FASE 7: PULIZIA ===
A fine lavoro elenca cosa occupa spazio (cache, render intermedi, modelli scaricati per prova) e chiedimi cosa cancellare. Tieni solo stile, effetti, ricetta e video approvati.
Inizia adesso dalla FASE 1: controlla il mio computer e fammi la prima domanda.
Domande frequenti
Serve sapere programmare per usarlo? No. L'IA guida l'intera configurazione passo passo, chiedendo il tuo ok prima di ogni installazione o scelta tecnica.
Funziona solo con Claude? No: lo stesso approccio funziona sia con Claude Opus 5.5 che con ChatGPT (GPT-6 Astra), cambia solo quale IA segue le istruzioni.
Quanto costa mettere in piedi il sistema? Gli strumenti di base (Node.js, FFmpeg, faster-whisper) sono gratuiti; l'unico costo è l'abbonamento a Claude o ChatGPT che usi già.
Funziona per qualsiasi piattaforma social? Sì: durante l'intervista sullo stile indichi per quali formati monti (Reels, TikTok, Shorts, YouTube orizzontale) e l'IA adatta l'impaginazione di conseguenza.