Thẻ Jev 1.13
Thẻ mô hình hiện hành, bí danh, giá và giới hạn.
Mô hình hiện hành là Jev 1.13 với ID phiên bản jev-1.13.0. Mọi mô hình trên thẻ của TypeSafe đều được phục vụ qua POST /v1/systemone; trường model trong yêu cầu chọn tên sẽ xử lý lệnh gọi. jev-latest là mặc định của SDK và hiện phân giải thành jev-1.13.0. jev-preview hiện cũng trỏ đến cùng ID; TypeSafe cho biết chưa có bản dựng xem trước. Hãy cố định ID phiên bản nếu bạn đã tinh chỉnh ngưỡng theo thẻ này.
Giá, ngữ cảnh và giới hạn tốc độ
Đầu vào có giá $42 cho mỗi tỷ token, tương đương $0.042 cho mỗi triệu. Token đầu ra miễn phí. Yêu cầu vượt quá mức công bố 250,000 token mỗi giây hoặc 1,200 yêu cầu mỗi phút sẽ trả về 429 Too Many Requests. Các SDK chính thức thử lại với thời gian chờ tăng dần và tuân theo retry-after khi có. TypeSafe cảnh báo rằng giới hạn đang được điều chỉnh linh hoạt khi nhu cầu cao và các thỏa thuận GPU được hoàn tất, đồng thời có thể thay đổi mà không báo trước. Gói tùy chỉnh và doanh nghiệp có thể nâng hạn mức qua sales@typesafe.ai.
Ngữ cảnh có giới hạn 64k token cho mỗi yêu cầu. Một hạn mức thứ hai là 32k token áp dụng cho trạng thái cộng với câu hỏi dài nhất. Jev nạp trạng thái một lần rồi đánh giá song song mọi câu hỏi dựa trên trạng thái đó, vì vậy cửa sổ 64k bao gồm trạng thái và toàn bộ câu hỏi cộng lại. Khi trạng thái phình to do các chi tiết không liên quan, độ chính xác giảm — dạng lỗi này được liệt kê trên trang jaggedness. Hãy gộp nhiều câu hỏi nhỏ bằng speculative fan-out thay vì nhồi toàn bộ kho dữ liệu vào một trường.
Đầu vào chỉ hỗ trợ văn bản: một chuỗi, một đối tượng JSON hoặc một mảng giá trị văn bản. Không hỗ trợ đầu vào hình ảnh, âm thanh hay video. Hãy tiền xử lý nội dung phi văn bản thành các trường trước khi gọi. Tiếng Anh là ngôn ngữ huấn luyện chính. Các ngôn ngữ khác, gồm cả CJK, được xử lý với độ chính xác thấp hơn, vì vậy hãy đo độ tin cậy trước khi tự động hóa hàng đợi không dùng tiếng Anh.
Jev 1.13
- Mã định danh mô hình
- jev-1.13.0
- role
- versioned-id
- Giá mỗi triệu token đầu vào (USD)
- 0.042
- Đầu ra được tính phí
- false
- Số token mỗi giây
- 250000
- số yêu cầu mỗi phút
- 1200
- Số token ngữ cảnh
- 64000
- trạng thái cộng số token của câu hỏi dài nhất
- 32000
- input
- text-only
jev-latest
- Mã định danh mô hình
- jev-latest
- role
- stable-alias
- Trỏ đến
- jev-1.13.0
- Mặc định của SDK
- true
jev-preview
- Mã định danh mô hình
- jev-preview
- role
- preview-alias
- Trỏ đến
- jev-1.13.0
- Có bản dựng xem trước
- false
Bí danh và danh sách mô hình
Bí danh là tên mô hình phân giải thành một ID phiên bản. Gửi bí danh trong trường model như mọi tên khác. jev-latest là bản phát hành chính thức ổn định mới nhất. jev-preview là bản phát hành mới nhất, bất kể có chính thức hay không, và sẽ đi trước jev-latest khi có bản dựng xem trước. Hiện tại, cả hai tên đều trỏ đến jev-1.13.0.
Bí danh sẽ chuyển khi có bản phát hành mới, nên câu trả lời phía sau nó có thể thay đổi dù phía bạn không đổi mã. Trường model trong phản hồi cho biết ID phiên bản đã trả lời. Hãy ghi nhật ký ID đó. Nếu các ngưỡng tin cậy được tinh chỉnh trên jev-1.13.0, hãy tiếp tục gửi jev-1.13.0 cho đến khi tinh chỉnh lại.
GET /v1/models trả về các tên tài khoản của bạn có thể gửi, kèm mô tả và ngày phát hành. Hiện API này liệt kê các bí danh. ID phiên bản như jev-1.13.0 vẫn được chấp nhận trong trường model dù có xuất hiện trong danh sách đó hay không.
Xử lý dữ liệu và tùy chỉnh
Jev không được tinh chỉnh hoặc điều chỉnh bằng LoRA trên dữ liệu khách hàng. Mô hình không được huấn luyện bằng yêu cầu hay phản hồi của khách hàng. Mọi tài khoản đều dùng cùng bộ trọng số RLCD. Bạn chuyên biệt hóa bằng nội dung trạng thái, chỉ dẫn, tiêu chí và cách kết hợp trong mã. Chỉ mục pháp lý của TypeSafe bao gồm DPA, chính sách quyền riêng tư và cơ chế không lưu giữ dữ liệu cho khách hàng doanh nghiệp.
Thời gian phản hồi đầu cuối được công bố là 70ms-500ms, với phần lớn truy vấn khoảng 100ms. Khoảng này là tuyên bố trong tài liệu ra mắt, không phải SLO độ trễ từ phép đo riêng của wiki này. Cần đọc cùng lưu ý về giới hạn tốc độ: thông lượng và RPM có thể thay đổi khi TypeSafe mở rộng chương trình truy cập sớm.
Nên gửi tên nào trong môi trường vận hành
Gửi jev-1.13.0 khi các ngưỡng bạn tinh chỉnh tuần trước phải giữ nguyên ý nghĩa vào tuần sau. Gửi jev-latest khi bạn muốn bản phát hành chính thức hiện tại của TypeSafe và sẽ xem lại biểu đồ phân bố độ tin cậy sau mỗi lần bí danh chuyển. Chỉ gửi jev-preview nếu bạn sẵn sàng dùng bản dựng không chính thức; hôm nay nó trỏ cùng nơi với jev-latest.
Ghi nhật ký response.model ở mọi lệnh gọi. Trường đó là ID phiên bản thực sự trả lời, ngay cả khi bạn gửi bí danh. Liên kết nó với requestId khi gỡ lỗi 429 hoặc một Noul bất ngờ. GET /v1/models không phải lúc nào cũng liệt kê jev-1.13.0 dù điểm cuối vẫn chấp nhận nó.
Chỉ tính giá cho phần đầu vào. Token đầu ra miễn phí, nên fan-out rẻ hơn một mô hình trò chuyện tính phí phần hoàn thành. Vòng lặp kiểu Doom với 10 truy vấn/giây ở mức $0.042/MTok là ví dụ khi ra mắt minh họa cho hiệu quả kinh tế này. Tuy vậy, vẫn phải tuân thủ giới hạn 1,200 RPM và 250,000 token mỗi giây; các con số này có thể thay đổi không báo trước trong giai đoạn truy cập sớm.
Khi bộ phận kinh doanh báo giá một giới hạn tùy chỉnh, con số đó chưa nằm trên thẻ này cho đến khi TypeSafe công bố tại docs.typesafe.ai/models. Trước thời điểm đó, số liệu công khai là 250,000 token mỗi giây và 1,200 yêu cầu mỗi phút, kèm cảnh báo rõ rằng chúng có thể thay đổi không báo trước. Cơ chế không lưu giữ dữ liệu doanh nghiệp là chủ đề trong chỉ mục pháp lý, không phải nút bật tắt trên thẻ mô hình.
Tiếng Anh vẫn là ngôn ngữ mạnh nhất trên thẻ này. Nếu xử lý phiếu hỗ trợ CJK, hãy đặt ngưỡng tin cậy chặt hơn và lấy mẫu hàng đợi của chính bạn trước khi bỏ khâu kiểm duyệt của con người. Mô hình vẫn nhận các ký tự đó; lưu ý về độ chính xác là lý do cần đo lường, không phải một lỗi 403 ẩn.
Bí danh chuyển là một sự kiện phát hành. Hãy đọc lại trang mô hình khi TypeSafe phát hành ID phiên bản mới, rồi quyết định các ngưỡng của bạn còn hiệu lực hay không. Thẻ trên trang này dành cho Jev 1.13, không phải lời hứa về 1.14.
Token đầu ra vẫn miễn phí trên thẻ này. Vì vậy, gộp thêm câu hỏi thường rẻ hơn thực hiện một lệnh gọi sinh nội dung thứ hai.
Nguồn