Schnellstart für Minicpm-Nutzer
Verbinde deinen bestehenden OpenAI-kompatiblen Client in unter einer Minute mit unserer unzensierten API. Ersetze die Base URL, setze deinen Schlüssel und beginne mit der Textgenerierung mit dem „unzensierten“ Modell.
Base URL und Authentifizierung
Um diese API zu nutzen, benötigst du einen API-Schlüssel und die korrekte Base URL. Unser Service ist vollständig mit den Standard-OpenAI-Clientbibliotheken kompatibel. Du musst keine neuen Abhängigkeiten installieren oder ein neues SDK lernen. Verweise einfach deinen bestehenden Client auf unseren Endpunkt.
Generiere einen Schlüssel auf der Seite API-Schlüssel erhalten. Du kannst dich mit Google anmelden oder E-Mail und Passwort verwenden. Der Schlüssel wird sofort angezeigt. Speichere ihn sicher. Jede Anfrage muss diesen Schlüssel im Authorization-Header enthalten.
Die Base URL für alle Anfragen ist: https://api.minicpm.cc/v1. Diese URL verarbeitet Chat-Vervollständigungen, Modellauflistungen und Streaming-Antworten. Es gibt keine separaten Endpunkte für Embeddings oder Vision. Dies ist eine API nur für Text.
Erste Anfrage
Sende eine Standard-Chat-Vervollständigungsanfrage, um mit der Textgenerierung zu beginnen. Die Modell-ID ist immer uncensored. Dieses Modell ist ein Open-Weight-LLM, das darauf abgestimmt ist, ohne Inhaltsablehnungen für die legale erwachsene Nutzung zu antworten. Es ist kein GPT, Claude oder ein anderes Modell eines anderen Anbieters.
Setze das Feld model auf uncensored. Gib deine Nachrichten im Standard-Array-Format an. Die API gibt eine Textantwort zurück. Du kannst die Ausgabelänge mit max_tokens steuern. Wenn du es nicht festlegst, beträgt die Standard-Ausgabe maximal 2.048 Token.
Python SDK-Integration
Verwende die offizielle OpenAI-Python-Bibliothek, um mit der API zu interagieren. Du musst nur die Base URL und den API-Schlüssel konfigurieren. Der Rest der Bibliothek funktioniert wie erwartet. Dies umfasst Unterstützung für Streaming, Function Calling und JSON-Modus.
Installiere die Bibliothek mit pip install openai. Initialisiere den Client mit deiner Base URL und deinem Schlüssel. Sende Nachrichten an den Chat-Vervollständigungs-Endpunkt. Das Antwortobjekt enthält den generierten Text, die Token-Nutzung und den Beendigungsgrund. Du kannst auf diese Felder direkt in deinem Python-Code zugreifen.
Node SDK-Integration
Das Node.js SDK funktioniert identisch zur Python-Version. Installiere das Paket und konfiguriere die Base URL. Der Client behandelt Authentifizierung und Anfrageformatierung automatisch. Dies ermöglicht eine schnelle Integration der API in deine Backend-Services.
Übergib die Base URL und den API-Schlüssel an den OpenAI-Client-Konstruktor. Verwende die Methode chat.completions.create. Die Antwortstruktur entspricht dem OpenAI-Standard. Du kannst Fehler behandeln, die Token-Nutzung prüfen und den Inhalt verarbeiten. Dieser Ansatz gewährleistet Kompatibilität mit bestehenden Codebasen, die bereits OpenAI nutzen.
Streaming-Antworten
Aktiviere Streaming, indem du stream: true in deiner Anfrage setzt. Die API gibt eine Sequenz von Server-Sent Events (SSE) zurück. Jedes Ereignis enthält einen Chunk der Antwort. Dies ermöglicht es dir, Text an den Benutzer anzuzeigen, während er generiert wird.
Der letzte Chunk enthält die Token-Nutzungsstatistiken. Dies ist nützlich für die Kostenverfolgung. Streaming reduziert die wahrgenommene Latenz für Benutzer. Es wird für Chat-Schnittstellen empfohlen. Du kannst die Ereignisse in deinem Client-Code parsen, um die finale Antwort zu erstellen oder Token in Echtzeit anzuzeigen.
Limits, Fehler und Kontext
Das Modell unterstützt ein Kontextfenster von 100.000 Token. Dies umfasst sowohl den Prompt als auch die Vervollständigung. Die maximale Ausgabe pro Anfrage beträgt 32.000 Token. Du kannst den Parameter max_tokens anpassen, um dies zu steuern.
Die Ratenlimits liegen bei 300 Anfragen pro Minute pro Schlüssel. Du kannst 8 parallele Anfragen haben. Der Anfragekörper muss unter 8 MB liegen. Wenn der Schlüssel ungültig ist, erhältst du einen 401-Fehler. Wenn du kein Guthaben hast, erhältst du einen 402-Fehler. Wenn du das Ratenlimit überschreitest, erhältst du einen 429-Fehler. Fehler und Ablehnungen verbrauchen kein Guthaben.
cURL
curl https://api.minicpm.cc/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'Python
from openai import OpenAI
client = OpenAI(base_url="https://api.minicpm.cc/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)Node.js
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.minicpm.cc/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);Streaming
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)Funktionen und Limits
Eine Tabelle mit jedem Limit, jeder Funktion und jedem Preis.
| Merkmal | Wert |
|---|---|
| API-Format | OpenAI-kompatibel: jedes OpenAI-SDK funktioniert – nur Base-URL und Schlüssel ändern |
| Base-URL | https://api.minicpm.cc/v1 |
| Modell-ID | uncensored |
| Authentifizierung | Authorization: Bearer YOUR_KEY |
| Endpunkte | POST /v1/chat/completions · GET /v1/models |
| Parameter | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| Streaming | ja – Server-Sent Events, der letzte Chunk enthält die Token-Nutzung |
| Function Calling | ja – tools, tool_choice; Antworten mit tool_calls, auch im Stream; Ergebnisse als role: tool |
| JSON-Modus | response_format: {"type": "json_object"} |
| Kontextfenster | 100.000 Tokens (Eingabe + Ausgabe) |
| Max. Ausgabe | bis zum Rest des 100.000-Token-Fensters; max_tokens optional (kein separates Limit) |
| Parallelität | 8 gleichzeitige Anfragen pro Schlüssel |
| Anfragegröße | bis 8 MB |
| Ratenlimit | 300 Anfragen pro Minute und Schlüssel |
| Antwort-Header | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| Abrechnung | Prepaid-Guthaben nach echter Nutzung; Fehler und Ablehnungen sind kostenlos |
| Aufladen | USDT (TRC20) oder USDC (Base), jeder ganze Betrag von $10 bis $500 |
| Gültigkeit | bezahltes Guthaben verfällt nie, kein Abo |
| Preis | $0,25 pro 1 Mio. Eingabe-Tokens · $1,00 pro 1 Mio. Ausgabe-Tokens |
| Testguthaben | $0,50 für 7 Tage, ohne Karte · Testschlüssel: 2 parallele Anfragen, 60 pro Minute; volle Limits (8 und 300) nach erster Aufladung |
| Bonus | +5 % ab $50, +10 % ab $100 |
| Anmeldung | Google oder E-Mail und Passwort |
| Inhalte | Inhalte für Erwachsene erlaubt; sexuelle Inhalte mit Minderjährigen werden abgelehnt |
| Schlüssel | ein aktiver Schlüssel pro Konto; ein neuer ersetzt den alten |
Fehlercodes
Fehler kommen als JSON mit festem type; fehlgeschlagene oder abgelehnte Anfragen kosten nichts.
| Code | Typ | Bedeutung |
|---|---|---|
400 | bad_request | ungültiges JSON, leere Nachrichten, falscher Parameter oder Kontext zu lang |
401 | missing_key · invalid_key · key_revoked | Schlüssel fehlt, ist falsch oder wurde ersetzt |
402 | no_credit | kein Guthaben – aufladen, dann geht es sofort weiter |
403 | content_blocked | sexuelle Inhalte mit Minderjährigen – abgelehnt, nicht berechnet |
404 | not_found | unbekannter Endpunkt |
413 | request_too_large | Anfrage größer als 8 MB |
429 | rate_limited · concurrency | über 300/Min. oder 8 parallel – kurz warten |
503 | upstream_busy | Modell ausgelastet – in Sekunden erneut versuchen |
Fragen und Antworten
Wie groß ist das Kontextfenster?
Das Kontextfenster umfasst 100.000 Token, sowohl den Eingabe-Prompt als auch die Ausgabe-Vervollständigung. Die maximale Ausgabe pro Anfrage beträgt 32.000 Token.
Wie gehe ich mit Fehlern um?
Ein 401-Fehler bedeutet einen ungültigen API-Schlüssel. Ein 402-Fehler bedeutet, dass dein Prepaid-Guthaben aufgebraucht ist. Ein 429-Fehler bedeutet, dass du das Ratenlimit von 300 Anfragen pro Minute überschritten hast. Fehler verbrauchen kein Guthaben.
Kann ich Streaming nutzen?
Ja. Setze <code>stream: true</code> in deiner Anfrage. Die API gibt Server-Sent Events (SSE) zurück. Der letzte Chunk enthält die Token-Nutzungsstatistiken.
Dein Schlüssel ist nur ein Formular entfernt
Erstelle ein Konto, kopiere den Schlüssel, ändere die Base URL. Das ist die gesamte Einrichtung.