Come configurare correttamente i tuoi AI Agent nei livelli di utilizzo OpenAI.

Una volta configurato un Agente IA, uno dei suoi compiti principali è comprendere l’intento del chiamante e trasferire la chiamata all’interno corretto. Tuttavia, è fondamentale considerare che il vostro Agente IA deve avere accesso al servizio OpenAI e non deve essere soggetto ai limiti di token al minuto (rate limits). Se l’Agente IA raggiunge un limite, il chiamante non riceverà risposta e il flusso della chiamata si interromperà: la chiamata non verrà trasferita e l’utente riaggancerà.

Per evitare di raggiungere i rate limit, ecco alcune linee guida da seguire.

Questo articolo è piuttosto dettagliato! In sintesi, tratteremo:

  • I principali messaggi di log quando vengono raggiunti i limiti
  • Una spiegazione matematica del consumo dei token
    • La complessità tecnica della chiamata e il suo impatto
    • L’impatto delle basi di conoscenza
  • Come tradurre i limiti in chiamate simultanee gestibili
  • Come configurare e modificare i limiti di token in OpenAI
    • Gli account OpenAI che pagano un minimo di 100€ vengono in genere elevati direttamente al Livello 3.

Messaggi di log quando vengono raggiunti i limiti

Quando si raggiunge un limite di OpenAI, è possibile verificarlo nel file 3CXAI.log.

Questo indica chiaramente che:

2026-03-09 10:17:26.674|DEBUG|{'call': 110, 'dir': 'ai', 'detail': True} [OpenAI] response.done content> :
{'type': 'response.done', 'event_id': 'event_DHYWMxZ4ipQABCDEFGHIJ', 'response':
{'object': 'realtime.response', 'id': 'resp_DHYWMnVTGk1234567890', 'status': 'failed', 'status_details':
{'type': 'failed', 'error':
{'type': 'tokens', 'code': 'rate_limit_exceeded',
'message': 'Rate limit reached for gpt-4o-realtime in organization org-LwDoeGAu4fbAABBCCDDEEFF on tokens per min (TPM): Limit 40000, Used 31222, Requested 14701. Please try again in 8.805s.
Visit https://platform.openai.com/account/rate-limits to learn more.'}},
'output': [], 'conversation_id': 'conv_DHYW8SqVAABBCCDDEEFFG', 'output_modalities': ['audio'], 'max_output_tokens': 'inf', 'audio': {'output': {'format': {'type': 'audio/pcm', 'rate': 24000}, 'voice': 'marin'}},
'usage': {'total_tokens': 0, 'input_tokens': 0, 'output_tokens': 0, 'input_token_details': {'text_tokens': 0, 'audio_tokens': 0, 'image_tokens': 0, 'cached_tokens': 0, 'cached_tokens_details':
{'text_tokens': 0, 'audio_tokens': 0, 'image_tokens': 0}}, 'output_token_details': {'text_tokens': 0, 'audio_tokens': 0}}, 'metadata': None}}
  • É stato raggiunto il limite di token per minuto (TPM)
  • Non è possibile elaborare richieste per alcuni secondi

Dal punto di vista matematico:

  • Il limite è 40.000 token al minuto
  • Ne sono stati utilizzati 31.222
  • Ne restano 8.778 disponibili
  • La richiesta necessitava 14.701 token, superando il limite disponibile

Consumo dei Token – Stima approssimativa

Conversazione naturale

  • Il consumo dipende da diversi fattori:
    • Lingua
    • Modello utilizzato
    • Stile della conversazione
    • Numero di parole
  • Ipotesi realistiche:
    • Una conversazione media è di circa 150 parole al minuto
    • Durata massima: 7 minuti
    • Totale: circa 1.050 parole
  • Conversione token (inglese): 1 parola ≈ 1,3 token
    • Una chiamata da 7 minuti ≈ 1.365 token

Possiamo quindi stimare una conversazione standard intorno ai 1.500 token.

In base alla complessità della chiamata

  • Chiamate semplici (es. prenotazioni):
    • Circa 1.000 token
  • Conversazioni normali:
    • Circa 1.500 token
  • Chiamate tecniche e complesse:
    • Fino a 2.500 token

Agente IA con basi di conoscenza

Se utilizzate le basi di conoscenza considera un overhead fino a 2.000 token aggiuntivi per il recupero delle informazioni.

Stima totale

Una chiamata tecnica con base di conoscenza può consumare:

  • 2.500 token per la chiamata
  • 2.000 token per il recupero dati

Aggiungendo un buffer di sicurezza (500 token), si arriva a circa 5.000 token per chiamata, ovvero circa 1.000 token al minuto.

Quante chiamate IA simultanee potete gestire?

Dovete considerare due limiti:

  • Token per minuto (TPM)
  • Richieste per minuto (RPM)

Token per minuto

Se il limite è 20.000 TPM, con un consumo di 1.000 TPM per chiamata, potete gestire circa 20 chiamate simultanee.

Richieste per minuto

Ogni chiamata può generare più richieste. Ad esempio:

  • 50 chiamate simultanee
  • 3 richieste al minuto per chiamata

→ Necessari almeno 150 RPM.

Configurare i livelli di utilizzo OpenAI

Molti utenti partono dal piano gratuito, quindi è normale incontrare limiti.
Gli account OpenAI che pagano un minimo di 100€ vengono in genere elevati direttamente al Livello 3.

Nel portale OpenAI:

  • Andate su Project → Limits
  • Selezionate “Rate limits”
  • Scegliete i modelli da configurare cliccando su “Select models”

Livelli di utilizzo OpenAI

Nella sezione Realtime:

Livelli utilizzo OpenAI

  • TPM = Token per minuto
  • RPM = Richieste per minuto

Lo screenshot qui sopra mostra un account che rientra nel piano gratuito; come potete vedere, i limiti massimi consentiti sono 40.000 TPM e 3 RPM. Accedete alla pagina Organization -> Limits e modificate il vostro budget per passare a un piano superiore.

Per aumentare i limiti:

Limiti OpenAI

  • Andate su Organization → Limits
  • Aumentate il budget pe passare ud un tier più alto.

Per ulteriori dettagli, potete cliccare sul link alla guida sui limiti di velocità; ecco la tabella principale dei livelli di utilizzo:

Tier utente Open AI

Una volta raggiunte le soglie richieste, il vostro livello verrà aggiornato automaticamente. Tornate alla pagina Project -> Limits per aumentare i limiti a secondo della necessità.

Forum

Discutiamo insieme di questo argomento sul nostro Forum. Seguici su X e LinkedIn per rimanere aggiornato sulle ultime novità e funzionalità.