Quotenverwaltung
KI-Kosten können ohne Kontrolle schnell steigen. Das Quotensystem von Almirant bietet die Schutzplanken, die du brauchst, um Ausgaben im Griff zu behalten, ohne jede Ausführung einzeln verwalten zu müssen.
Was Quoten sind
Quoten sind konfigurierbare Grenzen, die festlegen, wie viel deine Organisation in Bezug auf Folgendes verbrauchen kann:
| Metrik | Beschreibung |
|---|---|
| Tokens | Maximale Anzahl von Tokens, die verarbeitet werden können |
| Kosten in USD | Maximale Ausgaben in US-Dollar |
| Anfragen | Maximale Anzahl von Aufrufen der Anbieter-API |
Du kannst für jeden KI-Anbieter (OpenAI, Anthropic) unabhängige Quoten konfigurieren und je nach Zeitraum unterschiedliche Grenzen festlegen.
Zeitraumtypen
Quoten werden pro Zeitraum konfiguriert. So kannst du Grenzen festlegen, die zu deinem Budget passen:
| Typ | Beschreibung | Anwendungsfall |
|---|---|---|
| Täglich | Wird alle 24 Stunden um Mitternacht (UTC) zurückgesetzt | Granulare Kontrolle für Teams mit intensiver Nutzung |
| Wöchentlich | Wird jeden Montag um Mitternacht (UTC) zurückgesetzt | Gleichgewicht zwischen Flexibilität und Kontrolle |
| Monatlich | Wird am ersten Tag jedes Monats zurückgesetzt | Ausrichtung an Abrechnungszyklen |
Wir empfehlen, mit monatlichen Quoten zu beginnen, die auf dein KI-Budget abgestimmt sind, und tägliche Quoten hinzuzufügen, wenn du Verbrauchsspitzen feststellst, die die Verfügbarkeit für das gesamte Team beeinträchtigen.
Quoten konfigurieren
So konfigurierst du die Quoten deiner Organisation:
- Öffne Einstellungen > Kontingentverwaltung.
- Wähle den Anbieter aus, den du konfigurieren möchtest.
- Lege die Grenzen für jeden Zeitraumtyp fest:
- Maximale Tokens: Token-Limit pro Zeitraum
- Maximale Kosten in USD: Ausgabenlimit in Dollar
- Maximale Anfragen: Limit für API-Aufrufe
- Aktiviere oder deaktiviere die Quote über den Schalter Aktiv.
- Speichere die Änderungen.
Konfiguration pro Anbieter
Jeder Anbieter kann unabhängige Konfigurationen haben. Das ist nützlich, wenn:
- Du jedem Anbieter ein anderes Budget zugewiesen hast.
- Du einen Anbieter stärker begrenzen möchtest, während du einen anderen testest.
- Du die Kosten von Premium-Modellen wie o1 getrennt kontrollieren musst.
Ejemplo de configuracion:
OpenAI:
- Mensual: 500,000 tokens / $50 USD / 1,000 solicitudes
- Diario: 50,000 tokens / $10 USD / 200 solicitudes
Anthropic:
- Mensual: 300,000 tokens / $30 USD / 500 solicitudes
Warnsystem
Almirant benachrichtigt dich proaktiv, wenn dein Verbrauch die konfigurierten Grenzen erreicht. Warnungen werden bei den folgenden Schwellenwerten ausgelöst:
| Warnungstyp | Schwellenwert | Empfohlene Aktion |
|---|---|---|
| warning_75 | 75 % der Grenze | Überwache den Verbrauch genau |
| warning_80 | 80 % der Grenze | Erwäge, nicht kritische Vorgänge zu reduzieren |
| warning_90 | 90 % der Grenze | Bereite bei Bedarf eine Quotenanhebung vor |
| exceeded | 100 % der Grenze | Quote aufgebraucht, neue Vorgänge blockiert |
Warnungen erhalten
Warnungen werden an Folgendes gesendet:
- Organisationsadministratoren: Erhalten alle Warnungen per E-Mail.
- Konfigurationspanel: Aktive Warnungen erscheinen im Quotenbereich.
- Dashboard: Visueller Indikator, wenn Warnungen ausstehen.
Warnungen bestätigen
Du kannst eine Warnung bestätigen, um anzugeben, dass du bereits gehandelt hast:
- Öffne Einstellungen > Kontingentverwaltung.
- Klicke im Bereich Aktive Warnungen auf die Warnung.
- Wähle Bestätigen, um sie als bearbeitet zu markieren.
Bestätigte Warnungen werden im selben Zeitraum nicht erneut angezeigt. Eine neue Warnung wird jedoch erzeugt, wenn der nächste Schwellenwert erreicht wird.
Aktuelle Nutzung anzeigen
Die Seite zur Quotenverwaltung zeigt eine Zusammenfassung des aktuellen Verbrauchs nach Anbieter und Zeitraum:
| Feld | Beschreibung |
|---|---|
| Anbieter | OpenAI oder Anthropic |
| Zeitraumtyp | Täglich, wöchentlich oder monatlich |
| Verwendete / maximale Tokens | Aktueller Verbrauch gegenüber Grenze |
| Verwendete / maximale Kosten | Aktuelle Ausgaben gegenüber Grenze |
| Verwendete / maximale Anfragen | Aktuelle Aufrufe gegenüber Grenze |
| Prozentsatz | Visueller Verbrauchsindikator |
| Zeitraumende | Zeitpunkt der Quotenrücksetzung |
Der angezeigte Prozentsatz entspricht der höchsten Metrik unter Tokens, Kosten und Anfragen. So siehst du den restriktivsten Indikator.
Automatische Wiederaufnahme
Nach Ende eines Zeitraums werden Quoten automatisch zurückgesetzt:
- Zähler zurücksetzen: Die Zähler für Tokens, Kosten und Anfragen werden auf null zurückgesetzt.
- Vorgänge entsperren: Blockierte Vorgänge können fortgesetzt werden.
- Warnungen bereinigen: Warnungen des vorherigen Zeitraums werden archiviert.
Du musst nichts manuell tun, damit die Quote erneuert wird.
Verhalten blockierter Vorgänge
Wenn die Quote aufgebraucht ist:
- KI-Planung: Neue Gespräche zeigen eine Meldung zur aufgebrauchten Quote.
- KI-Agenten: Jobs verbleiben im Status
pendingund werden automatisch verarbeitet, sobald Quote verfügbar ist. - Laufende Jobs: Werden nicht unterbrochen, können aber keine neuen Anbieteraufrufe starten.
Nach Erneuerung der Quote werden ausstehende Jobs in FIFO-Reihenfolge verarbeitet (first in, first out).
Bewährte Verfahren
- Frühzeitige Warnungen konfigurieren -- Der Schwellenwert von 75 % gibt dir Zeit zu reagieren, bevor die Quote aufgebraucht ist.
- Tägliche Quoten für granulare Kontrolle verwenden -- Wenn dein Team an einem Tag viel verbraucht, verhindert eine tägliche Quote einen Ausfall für den Rest der Woche.
- Monatliche Quoten an die Abrechnung anpassen -- Konfiguriere Grenzen, die deinem monatlichen KI-Budget entsprechen.
- Aufschlüsselung nach Projekt prüfen -- Identifiziere Projekte mit hohem Verbrauch, um sie zu optimieren oder Erwartungen anzupassen.
- Spielraum für Notfälle reservieren -- Konfiguriere Quoten nicht auf 100 % des Budgets, sondern lasse 10 bis 15 % Spielraum.
MCP-Tools
Die folgenden Tools sind über MCP verfügbar, um Quoten abzufragen und zu prüfen:
| Tool | Beschreibung | Hauptparameter |
|---|---|---|
check_quota | Prüft, ob Quote für einen Vorgang verfügbar ist | organizationId, provider, estimatedTokens |
get_quota_usage | Ruft Verbrauchsdetails nach Anbieter und Zeitraum ab | organizationId, provider, periodType |
Beispiel: Quote vor einem Vorgang prüfen
Tool: check_quota
Parametros:
organizationId: "uuid-de-la-organizacion"
provider: "openai"
estimatedTokens: 10000
Antwort bei verfügbarer Quote:
{
"available": true,
"provider": "openai",
"remainingTokens": 45000,
"remainingCostUsd": 12.50,
"remainingRequests": 150,
"periodEnd": "2024-02-01T00:00:00Z"
}
Antwort ohne verfügbare Quote:
{
"available": false,
"provider": "openai",
"remainingTokens": 0,
"reason": "exceeded",
"periodEnd": "2024-02-01T00:00:00Z"
}
Beispiel: Detaillierte Nutzung abfragen
Tool: get_quota_usage
Parametros:
organizationId: "uuid-de-la-organizacion"
provider: "openai"
periodType: "monthly"
Antwort:
{
"provider": "openai",
"periodType": "monthly",
"maxTokens": 500000,
"maxCostUsd": 50.00,
"maxRequests": 1000,
"usedTokens": 125000,
"usedCostUsd": 12.50,
"usedRequests": 250,
"percentTokens": 25,
"percentCost": 25,
"percentRequests": 25,
"periodStart": "2024-01-01T00:00:00Z",
"periodEnd": "2024-02-01T00:00:00Z"
}
Datenmodell
Als technische Referenz folgen die wichtigsten Typen des Quotensystems:
QuotaConfig
| Feld | Typ | Beschreibung |
|---|---|---|
id | UUID | Eindeutiger Konfigurationsbezeichner |
provider | string | KI-Anbieter (openai, anthropic) |
quotaType | QuotaType | Zeitraumtyp (daily, weekly, monthly) |
maxTokens | number | Token-Limit |
maxCostUsd | number | Kostenlimit in USD |
maxRequests | number | Anfragelimit |
isActive | boolean | Gibt an, ob die Quote aktiv ist |
UsageSummaryItem
| Feld | Typ | Beschreibung |
|---|---|---|
provider | string | KI-Anbieter |
periodType | QuotaType | Zeitraumtyp |
maxTokens | number | Konfiguriertes Limit |
usedTokens | number | Verbrauchte Tokens |
percentTokens | number | Nutzungsprozentsatz (0–100) |
maxCostUsd | number | Kostenlimit |
usedCostUsd | number | Verbrauchte Kosten |
percentCost | number | Kostenprozentsatz |
maxRequests | number | Anfragelimit |
usedRequests | number | Durchgeführte Anfragen |
percentRequests | number | Anfragenprozentsatz |
periodEnd | DateTime | Ende des aktuellen Zeitraums |
QuotaAlert
| Feld | Typ | Beschreibung |
|---|---|---|
id | UUID | Warnungsbezeichner |
providerQuotaId | UUID | Referenz auf QuotaConfig |
alertType | AlertType | Warnungstyp (warning_75, warning_80, warning_90, exceeded) |
periodStart | DateTime | Beginn des Warnzeitraums |
message | string | Beschreibende Nachricht |
acknowledgedAt | DateTime | Bestätigungsdatum (null, falls nicht bestätigt) |