Teorema: un panel di 5 IA che discutono tra loro (architettura n8n)
Yuri Perfetti5 min0 lettureTempo di lettura: 9 minuti — Livello: intermedio
L'idea (e perché non è un giocattolo)
Chiunque usi le IA seriamente ha notato una cosa: modelli diversi sbagliano in modi diversi. Claude vede cose che GPT non vede, Gemini corregge entrambi, DeepSeek ogni tanto tira fuori l'angolo che nessuno aveva considerato. Su domande difficili — quelle dove una risposta sbagliata costa — la mossa furba non è scegliere il modello migliore: è farli discutere.
Da questa intuizione è nato Teorema: un workflow n8n che riceve una domanda via Telegram, la sottopone a cinque modelli in parallelo, li fa dibattere tra loro sulle risposte degli altri, e mi restituisce una sintesi moderata. Lo uso per le domande pesanti: decisioni tecniche, analisi complesse, e perfino un mio progetto di ricerca matematica personale — il campo di prova ideale, perché lì un'allucinazione si traveste benissimo da teorema.
L'architettura a tre round
Domanda via Telegram
│
▼
ROUND 0 — Risposta indipendente
├── Claude ──┐
├── GPT ─────┤
├── Gemini ──┼── 5 chiamate in parallelo
├── DeepSeek ┤
└── Perplexity ┘
│
▼
IL DOSSIER — un nodo raccoglie le 5 risposte
e costruisce un unico documento anonimizzato
│
▼
ROUND 1 — Il dibattito
└── le stesse 5 IA ricevono il dossier:
"ecco cosa hanno risposto altri panelisti;
conferma, correggi o confuta"
│
▼
IL MODERATORE — una sesta chiamata (Claude)
sintetizza: punti di consenso, disaccordi, verdetto
│
▼
Risposta su Telegram (in più messaggi)
I concetti chiave, uno per uno.
Round 0 — l'indipendenza prima di tutto. Le cinque IA rispondono alla domanda senza vedere le risposte altrui. È lo stesso principio delle perizie indipendenti: se il secondo perito legge la relazione del primo prima di scrivere la sua, non hai due pareri — ne hai uno e mezzo. Il parallelismo qui non è (solo) una questione di velocità: è una garanzia epistemica.
Il dossier — il cuore del sistema. Un nodo intermedio impagina le cinque risposte in un documento unico, e qui c'è la scelta di design più importante: le risposte sono anonimizzate ("Panelista A", "Panelista B"...). I modelli hanno opinioni sui loro concorrenti — se sanno che una tesi viene da GPT la trattano diversamente che se viene da un anonimo. Il dibattito deve essere sui contenuti, non sulle firme.
Round 1 — il dibattito vero. Ogni modello riceve il dossier con un mandato esplicito: confronta la tua risposta con le altre, difendi ciò che confermi, correggi dove ti sei sbagliato, confuta ciò che ritieni errato. È il passaggio dove succede la magia: gli errori isolati vengono smontati dal gruppo, e i punti su cui tutti e cinque convergono indipendentemente acquistano un peso che nessuna risposta singola può avere.
Il moderatore. Una sesta chiamata finale riceve tutto — domanda, round 0, round 1 — e produce la sintesi: dove c'è consenso, dove restano disaccordi (informazione preziosissima: un disaccordo persistente tra 5 modelli è la mappa esatta di dove NON fidarsi), e un verdetto operativo.
Scelte tecniche che hanno una storia
HTTP Request per tutti, niente nodi nativi. n8n ha nodi dedicati per alcuni provider, ma non per tutti (Perplexity e DeepSeek, per esempio, all'epoca non li avevano). E i nodi AI nativi sono pensati per il paradigma "agente", non per un flusso piatto di chiamate parallele. Cinque nodi HTTP identici nella struttura, che cambiano solo per endpoint e chiave: più codice a prima vista, ma un solo pattern da capire e debuggare. In un sistema con cinque fornitori diversi, l'uniformità batte la comodità.
La regola di fermarsi sugli errori. Con cinque API esterne, qualcuna ogni tanto è giù. La prima versione tirava dritto e il dibattito proseguiva zoppo, con il dossier che citava panelisti mai esistiti. La regola che ho adottato: se una chiamata del panel fallisce, il giro si ferma e mi arriva la notifica dell'errore — meglio nessuna risposta che una risposta che sembra un panel a cinque ed è un monologo a tre.
Le battaglie di guerra (le mie preferite)
Il limite dei 4096 caratteri di Telegram. Un dibattito a 5 voci più sintesi produce testi lunghi; Telegram taglia a 4096 caratteri a messaggio. Serve uno splitter che spezzi l'output. Facile? Quasi: con il parse mode Markdown attivo, tagliare il testo a 4000 caratteri può spezzare una formattazione a metà (un asterisco aperto e mai chiuso) e Telegram rifiuta l'intero messaggio con un errore di entity parsing criptico. Soluzione pragmatica: lo splitter ripulisce i caratteri di formattazione prima dell'invio. Brutale, ma da allora non ha mai più perso un messaggio.
Il nodo irraggiungibile. A un certo punto il moderatore ha smesso di funzionare con l'errore No path back to referenced node. Ore sul codice del nodo... e il problema era un collegamento mancante sul canvas: il moderatore riferiva dati di un nodo a cui non era graficamente connesso. Lezione n8n che vale un articolo da sola: le espressioni possono leggere solo dai nodi da cui discendono. In un tool visuale, il disegno È la logica.
Com'è cresciuto dopo
La versione attuale ha superato il monolite: ogni "voce" del panel è diventata un sub-workflow separato (Voce Claude, Voce GPT, Voce Mistral, Voce Grok...), richiamato dal flusso principale. Aggiungere un sesto panelista ora significa duplicare un piccolo workflow e cambiargli endpoint e chiave — cinque minuti. E per le domande matematiche c'è un passo pre-panel che interroga un motore di calcolo simbolico, così le IA ragionano sopra dati verificati invece che su numeri ricordati a memoria. Ma questa è materia per un altro articolo.
Vale i soldi che costa?
Ogni domanda a Teorema costa 11 chiamate API (5+5+1). Per chiedere che tempo fa, è un'assurdità. Per le domande in cui una risposta sbagliata mi costerebbe ore o una figuraccia, è l'assicurazione più economica che abbia mai comprato. Il criterio è lo stesso di sempre: la ridondanza si paga volentieri dove l'errore costa più della ridondanza. Gli ingegneri lo sanno da un secolo; con le IA vale identico.
Questo articolo fa parte della serie "Build in Public" su perfetti.tech — dove racconto quello che costruisco davvero, errori compresi.
Hai un problema simile?
Mandami due righe: ti dico se ha senso trasformarlo in uno strumento vero e quanto tempo serve.
Scrivimi →Commenti
Ancora nessun commento. Scrivi il primo!