Individu

Together AI

15 actualités

Dernières brèves

Nouveau modèle

Ollama ouvre un point d'accès aux modèles de décision et y branche Nimble de Bespoke Labs et Tev1 de Together AI

Ollama a publié le 28 septembre 2026 sa version 0.35.0, que GitHub ne classe pas en préversion, avec un point d'accès /v1/systemone dédié aux modèles de décision. Ces modèles rendent des choix, des probabilités et des scores au lieu de texte ; l'éditeur cite le tri de tickets, le routage entre modèles et la classification de contenus. L'interface reprend le contrat public de Jev, l'API de TypeSafe AI, et accepte trois types de question : un choix parmi des critères nommés avec la probabilité de chacun, la probabilité qu'une condition soit vraie, et un score sur un ensemble de critères ordonnés. Deux modèles figurent au catalogue, Nimble de Bespoke Labs et Tev1 de Together AI. La 0.35.0 répare aussi des téléchargements de modèles MLX bloqués et l'ouverture de la page de réglages.

Nouveau modèle

Together AI ouvre Tev1-4B, modèle de décision inspiré de Jev entraîné pour 17 dollars sur 38 340 exemples

Le 23 septembre 2026, Together AI a mis en ligne Tev1-4B-experimental, ajustement supervisé de Qwen3.5-4B qui choisit une option parmi 2 à 24 propositions à partir d’un état et d’une question structurés, et publié la recette complète de son entraînement. La société présente le modèle comme une expérience inspirée de Jev, sorti de l’ombre le 15 septembre avec TypeSafe AI, et non comme une réimplémentation : Tev1 conserve la tête de langage autorégressive de Qwen. L’apprentissage a porté sur 38 340 questions échantillonnées dans six jeux de données publics, pour un coût annoncé de 17 dollars et environ vingt-cinq minutes de calcul. La licence des poids ajustés n’est pas encore arrêtée, la base Qwen3.5-4B restant sous Apache 2.0. Sur son évaluation de développement, que Together signale comme non indépendante, le modèle rend 880 bonnes réponses sur 1 000 et 300 sur 300 sur un jeu de transfert de règles.

Nouveau modèle

Together AI détaille ses déploiements canari sur l'inférence dédiée : une barrière stoppe une régression de 137 %

Le 22 septembre 2026, Together AI a publié le fonctionnement de ses rollouts, qui basculent le trafic de production d'un modèle vers un autre sur un même point d'accès d'inférence dédiée. Trois stratégies coexistent : le canari par paliers de trafic, dont l'échelle par défaut monte à 5, 25, 50 puis 100 %, le bleu-vert en un seul palier, et le remplacement réplique par réplique. Chaque palier enchaîne la montée en charge de la cible, un contrôle de santé avant bascule, puis le drainage de la source. Dans la démonstration publiée, le passage de Qwen2.5-7B à Qwen3.5-9B a été arrêté à 10 % du trafic par une barrière sur la latence au 95e centile, qui a mesuré une dégradation de 137 %, sans aucune requête perdue. L'outil tg est livré dans le paquet Python together depuis la version 2.34.0, mise en ligne le 15 septembre.

Source : Together AI
Ranger dans…
Enregistré. Ajouter une note ?
Nouveau modèle

Together AI détaille l'infrastructure d'une fintech mondiale dont l'assistant de code tourne sur 56 GPU B200 et GLM 5.2

Le 18 septembre 2026, Together AI a publié le retour d'expérience d'un client qu'il ne nomme pas, une fintech présente sur des dizaines de marchés, dont l'assistant de code interne s'appuie sur le modèle ouvert GLM 5.2. Le point de production tourne sur 56 GPU B200, soit quatorze réplicas de quatre puces, avec une fenêtre de contexte de 256 000 jetons. Le trafic, concentré sur les heures ouvrées, monte à 178 000 jetons en entrée au 95e centile, pour 3 à 7 requêtes par seconde. Après un redimensionnement des réplicas, la capacité de préremplissage a saturé : requêtes en file une à trois minutes, débit de génération tombé à environ 5 jetons par seconde, une requête restée 192 secondes derrière un arriéré de 2,3 millions de jetons. Le client a rétabli lui-même la politique de routage du cache. Il a écarté une configuration à un million de jetons, préférant ses fenêtres de 256 000 et 512 000 jetons.

Source : Together AI
Ranger dans…
Enregistré. Ajouter une note ?
Nouveau modèle

Together AI ouvre son service de fine-tuning à GLM-5.3 et Kimi K2.7, expose les métriques en direct et baisse ses prix jusqu'à 70 %

Le 11 septembre 2026, Together AI a élargi son service géré de fine-tuning. La plateforme accepte désormais GLM-5.3, que l'entreprise mesure à 88,2 sur Terminal-Bench 2.1, ainsi que Kimi K2.7, Qwen 3.8-27B, Gemma 4 et la famille Qwen 3.5 de 0,8 à 9 milliards de paramètres. Chaque tâche d'entraînement enregistre la perte, la norme du gradient et le taux d'apprentissage à chaque pas, séries exposées par l'API, la ligne de commande et le tableau de bord pendant que le calcul tourne. Les adaptateurs LoRA peuvent être posés sur les couches d'experts des modèles à mélange d'experts, qui portent plus de 90 % des paramètres : sur 200 faits inventés, ces adaptateurs en restituent jusqu'à 89 %, contre 15 % pour des adaptateurs limités à l'attention, et l'emportent sur MMLU-Pro, 75,3 % contre 71,5 %. L'arrêt précoce sur la perte de validation rembourse les étapes non consommées. Les prix d'entraînement reculent de 30 % à 70 % selon les modèles, la borne haute visant la série gpt-oss.

Source : Together AI
Ranger dans…
Enregistré. Ajouter une note ?

Articles liés

5 au total