Come configurare correttamente i tuoi AI Agent nei livelli di utilizzo OpenAI.
Una volta configurato un Agente IA, uno dei suoi compiti principali è comprendere l’intento del chiamante e trasferire la chiamata all’interno corretto. Tuttavia, è fondamentale considerare che il vostro Agente IA deve avere accesso al servizio OpenAI e non deve essere soggetto ai limiti di token al minuto (rate limits). Se l’Agente IA raggiunge un limite, il chiamante non riceverà risposta e il flusso della chiamata si interromperà: la chiamata non verrà trasferita e l’utente riaggancerà.
Per evitare di raggiungere i rate limit, ecco alcune linee guida da seguire.
Questo articolo è piuttosto dettagliato! In sintesi, tratteremo:
- I principali messaggi di log quando vengono raggiunti i limiti
- Una spiegazione matematica del consumo dei token
- La complessità tecnica della chiamata e il suo impatto
- L’impatto delle basi di conoscenza
- Come tradurre i limiti in chiamate simultanee gestibili
- Come configurare e modificare i limiti di token in OpenAI
- Gli account OpenAI che pagano un minimo di 100€ vengono in genere elevati direttamente al Livello 3.
Messaggi di log quando vengono raggiunti i limiti
Quando si raggiunge un limite di OpenAI, è possibile verificarlo nel file 3CXAI.log.
Questo indica chiaramente che:
2026-03-09 10:17:26.674|DEBUG|{'call': 110, 'dir': 'ai', 'detail': True} [OpenAI] response.done content> :
{'type': 'response.done', 'event_id': 'event_DHYWMxZ4ipQABCDEFGHIJ', 'response':
{'object': 'realtime.response', 'id': 'resp_DHYWMnVTGk1234567890', 'status': 'failed', 'status_details':
{'type': 'failed', 'error':
{'type': 'tokens', 'code': 'rate_limit_exceeded',
'message': 'Rate limit reached for gpt-4o-realtime in organization org-LwDoeGAu4fbAABBCCDDEEFF on tokens per min (TPM): Limit 40000, Used 31222, Requested 14701. Please try again in 8.805s.
Visit https://platform.openai.com/account/rate-limits to learn more.'}},
'output': [], 'conversation_id': 'conv_DHYW8SqVAABBCCDDEEFFG', 'output_modalities': ['audio'], 'max_output_tokens': 'inf', 'audio': {'output': {'format': {'type': 'audio/pcm', 'rate': 24000}, 'voice': 'marin'}},
'usage': {'total_tokens': 0, 'input_tokens': 0, 'output_tokens': 0, 'input_token_details': {'text_tokens': 0, 'audio_tokens': 0, 'image_tokens': 0, 'cached_tokens': 0, 'cached_tokens_details':
{'text_tokens': 0, 'audio_tokens': 0, 'image_tokens': 0}}, 'output_token_details': {'text_tokens': 0, 'audio_tokens': 0}}, 'metadata': None}} - É stato raggiunto il limite di token per minuto (TPM)
- Non è possibile elaborare richieste per alcuni secondi
Dal punto di vista matematico:
- Il limite è 40.000 token al minuto
- Ne sono stati utilizzati 31.222
- Ne restano 8.778 disponibili
- La richiesta necessitava 14.701 token, superando il limite disponibile
Consumo dei Token – Stima approssimativa
Conversazione naturale
- Il consumo dipende da diversi fattori:
- Lingua
- Modello utilizzato
- Stile della conversazione
- Numero di parole
- Ipotesi realistiche:
- Una conversazione media è di circa 150 parole al minuto
- Durata massima: 7 minuti
- Totale: circa 1.050 parole
- Conversione token (inglese): 1 parola ≈ 1,3 token
- Una chiamata da 7 minuti ≈ 1.365 token
Possiamo quindi stimare una conversazione standard intorno ai 1.500 token.
In base alla complessità della chiamata
- Chiamate semplici (es. prenotazioni):
- Circa 1.000 token
- Conversazioni normali:
- Circa 1.500 token
- Chiamate tecniche e complesse:
- Fino a 2.500 token
Agente IA con basi di conoscenza
Se utilizzate le basi di conoscenza considera un overhead fino a 2.000 token aggiuntivi per il recupero delle informazioni.
Stima totale
Una chiamata tecnica con base di conoscenza può consumare:
- 2.500 token per la chiamata
- 2.000 token per il recupero dati
Aggiungendo un buffer di sicurezza (500 token), si arriva a circa 5.000 token per chiamata, ovvero circa 1.000 token al minuto.
Quante chiamate IA simultanee potete gestire?
Dovete considerare due limiti:
- Token per minuto (TPM)
- Richieste per minuto (RPM)
Token per minuto
Se il limite è 20.000 TPM, con un consumo di 1.000 TPM per chiamata, potete gestire circa 20 chiamate simultanee.
Richieste per minuto
Ogni chiamata può generare più richieste. Ad esempio:
- 50 chiamate simultanee
- 3 richieste al minuto per chiamata
→ Necessari almeno 150 RPM.
Configurare i livelli di utilizzo OpenAI
Molti utenti partono dal piano gratuito, quindi è normale incontrare limiti.
Gli account OpenAI che pagano un minimo di 100€ vengono in genere elevati direttamente al Livello 3.
Nel portale OpenAI:
- Andate su Project → Limits
- Selezionate “Rate limits”
- Scegliete i modelli da configurare cliccando su “Select models”

Nella sezione Realtime:

- TPM = Token per minuto
- RPM = Richieste per minuto
Lo screenshot qui sopra mostra un account che rientra nel piano gratuito; come potete vedere, i limiti massimi consentiti sono 40.000 TPM e 3 RPM. Accedete alla pagina Organization -> Limits e modificate il vostro budget per passare a un piano superiore.
Per aumentare i limiti:

- Andate su Organization → Limits
- Aumentate il budget pe passare ud un tier più alto.
Per ulteriori dettagli, potete cliccare sul link alla guida sui limiti di velocità; ecco la tabella principale dei livelli di utilizzo:

Una volta raggiunte le soglie richieste, il vostro livello verrà aggiornato automaticamente. Tornate alla pagina Project -> Limits per aumentare i limiti a secondo della necessità.
Forum
Discutiamo insieme di questo argomento sul nostro Forum. Seguici su X e LinkedIn per rimanere aggiornato sulle ultime novità e funzionalità.



