inference cost

Categoria: roi

Custo total de executar o modelo de linguagem para gerar uma resposta, incluindo tokens processados, tempo de GPU e eventuais custos de rede. Varia conforme o tamanho do modelo, o comprimento do contexto e o provedor.