Karta Jev 1.13
Aktualna karta modelu, aliasy, cena i limity.
Aktualnym modelem jest Jev 1.13 o wersjonowanym identyfikatorze jev-1.13.0. Każdy model na karcie TypeSafe jest obsługiwany przez POST /v1/systemone; pole model w żądaniu wskazuje nazwę obsługującą wywołanie. jev-latest jest domyślną wartością SDK i obecnie wskazuje jev-1.13.0. jev-preview obecnie wskazuje ten sam identyfikator; TypeSafe informuje, że kompilacja testowa nie jest dostępna. Używaj wersjonowanego identyfikatora, jeśli progi dostrojono pod tę kartę.
Cena, kontekst i limity wywołań
Dane wejściowe kosztują $42 za miliard tokenów, czyli $0.042 za milion. Tokeny wyjściowe są bezpłatne. Żądanie przekraczające udokumentowany limit 250,000 tokenów na sekundę lub 1,200 żądań na minutę zwraca 429 Too Many Requests. Oficjalne SDK ponawiają próby ze stopniowo wydłużanym opóźnieniem i respektują retry-after, jeśli jest dostępne. TypeSafe ostrzega, że limity są dynamicznie dostosowywane przy dużym popycie i zawieraniu umów na GPU oraz mogą się zmienić bez powiadomienia. Plany niestandardowe i korporacyjne mogą uzyskać wyższy limit przez sales@typesafe.ai.
Kontekst na każde żądanie wynosi 64k tokenów. Osobny budżet 32k tokenów obejmuje stan oraz najdłuższe pytanie. Jev wczytuje stan raz i równolegle ocenia względem niego każde pytanie, dlatego okno 64k obejmuje łącznie stan i wszystkie pytania. Gdy stan rozrasta się o niepowiązane szczegóły, trafność spada — ten tryb błędu opisano na stronie jaggedness. Grupuj wiele małych pytań za pomocą speculative fan-out, zamiast upychać całą hurtownię w jednym polu.
Dane wejściowe mogą zawierać wyłącznie tekst: ciąg znaków, obiekt JSON albo tablicę wartości tekstowych. Obrazy, dźwięk i wideo nie są obsługiwane. Przed wywołaniem przekształć dane nietekstowe w pola. Głównym językiem treningowym jest angielski. Inne języki, w tym CJK, są obsługiwane z niższą trafnością, dlatego przed automatyzacją kolejki nieanglojęzycznej mierz pewność.
Jev 1.13
- identyfikator modelu
- jev-1.13.0
- role
- versioned-id
- Cena za milion tokenów wejściowych (USD)
- 0.042
- Rozliczane dane wyjściowe
- false
- tokeny na sekundę
- 250000
- żądania na minutę
- 1200
- Tokeny kontekstu
- 64000
- Stan + liczba tokenów najdłuższego pytania
- 32000
- input
- text-only
jev-latest
- identyfikator modelu
- jev-latest
- role
- stable-alias
- wskazuje na
- jev-1.13.0
- Domyślna wartość SDK
- true
jev-preview
- identyfikator modelu
- jev-preview
- role
- preview-alias
- wskazuje na
- jev-1.13.0
- Dostępna wersja testowa
- false
Aliasy i wyświetlanie modeli
Alias to nazwa modelu wskazująca wersjonowany identyfikator. Przekazuj go w polu model tak samo jak każdą inną nazwę. jev-latest oznacza najnowsze stabilne oficjalne wydanie. jev-preview oznacza najnowsze wydanie bez względu na jego oficjalny status i wyprzedza jev-latest, gdy istnieje kompilacja testowa. Obecnie obie nazwy wskazują jev-1.13.0.
Alias zmienia się po wydaniu nowej wersji, więc zwracane przez niego odpowiedzi mogą ulec zmianie bez modyfikacji kodu po twojej stronie. Pole model w odpowiedzi podaje wersjonowany identyfikator modelu, który odpowiedział. Zapisuj ten identyfikator w logach. Jeśli progi pewności dostrojono na jev-1.13.0, nadal wysyłaj jev-1.13.0 aż do ponownego strojenia.
GET /v1/models zwraca nazwy dostępne dla twojego konta wraz z opisem i datą wydania. Obecnie lista obejmuje aliasy. Wersjonowane identyfikatory, takie jak jev-1.13.0, są akceptowane w polu model niezależnie od tego, czy widnieją na tej liście.
Przetwarzanie danych i dostosowywanie
Jev nie jest dostrajany ani adaptowany metodą LoRA na danych klientów. Nie trenuje się go na żądaniach ani odpowiedziach klientów. Te same wagi RLCD obsługują każde konto. Specjalizację uzyskujesz przez zawartość stanu, instrukcje, kryteria i kompozycję w kodzie. Indeks prawny TypeSafe obejmuje DPA, politykę prywatności oraz zerową retencję danych klientów korporacyjnych.
Deklarowany pełny czas odpowiedzi wynosi 70ms-500ms, a większość zapytań trwa około 100ms. Ten zakres to twierdzenie opublikowane w materiałach premierowych, a nie cel SLO opóźnień wynikający z własnych pomiarów tej wiki. Należy go rozpatrywać razem z uwagą o limitach: przepustowość i RPM mogą się zmieniać, gdy TypeSafe skaluje wczesny dostęp.
Którą nazwę wysyłać w środowisku produkcyjnym
Wysyłaj jev-1.13.0, jeśli reguły dopuszczenia dostrojone w zeszłym tygodniu mają zachować to samo znaczenie w przyszłym. Wysyłaj jev-latest, jeśli chcesz korzystać z bieżącego oficjalnego wydania TypeSafe i po każdej zmianie aliasu ponownie przeanalizujesz histogramy pewności. Wysyłaj jev-preview tylko wtedy, gdy akceptujesz nieoficjalną kompilację; obecnie wskazuje ona to samo co jev-latest.
Przy każdym wywołaniu zapisuj response.model w logach. Pole to zawiera wersjonowany identyfikator modelu, który faktycznie odpowiedział, nawet jeśli wysłano alias. Połącz go z requestId podczas diagnozowania błędu 429 lub zaskakującego wyniku Noul. GET /v1/models nie zawsze wyświetli jev-1.13.0, choć punkt końcowy go akceptuje.
Naliczaj koszt wyłącznie za dane wejściowe. Tokeny wyjściowe są bezpłatne, więc fan-out jest tani w porównaniu z modelem czatu pobierającym opłatę za wygenerowaną odpowiedź. Pętla w stylu Doom, wykonująca 10 zapytań na sekundę przy cenie $0.042/MTok, to premierowy przykład tej ekonomiki. Nadal przestrzegaj limitów 1,200 RPM i 250,000 tokenów na sekundę; w okresie wczesnego dostępu wartości te mogą ulec zmianie bez powiadomienia.
Gdy dział sprzedaży poda niestandardowy limit, wartość ta nie pojawi się na tej karcie, dopóki TypeSafe nie opublikuje jej na docs.typesafe.ai/models. Do tego czasu publiczne limity wynoszą 250,000 tokenów na sekundę i 1,200 żądań na minutę, z wyraźnym ostrzeżeniem, że mogą się zmienić bez powiadomienia. Zerowa retencja danych korporacyjnych jest zagadnieniem z indeksu prawnego, a nie przełącznikiem na karcie modelu.
Angielski pozostaje najlepiej obsługiwanym językiem na tej karcie. Jeśli obsługujesz zgłoszenia w językach CJK, ustaw bardziej rygorystyczne progi pewności i przebadaj własną kolejkę przed wyłączeniem udziału ludzi. Model przyjmie te znaki; uwaga o trafności oznacza konieczność pomiaru, a nie ukryty błąd 403.
Zmiana aliasu jest zdarzeniem związanym z wydaniem. Gdy TypeSafe opublikuje nowy wersjonowany identyfikator, ponownie przeczytaj stronę modeli i oceń, czy reguły dopuszczenia nadal działają. Karta na tej stronie dotyczy Jev 1.13 i nie stanowi obietnicy dotyczącej 1.14.
Na tej karcie tokeny wyjściowe pozostają bezpłatne. Dlatego dołączenie dodatkowych pytań jest zwykle tańsze niż drugie wywołanie generatywne.
Źródła