Süni intellekt yarışında lider dəyişir: cəmi bir həftədə üç fərqli nəticə



Süni intellekt modellərinin performansını izləyən müstəqil platformalardan biri olan Artificial Analysis öz Intelligence Index sistemində qısa müddət ərzində üç dəfə dəyişiklik edib. 

AFN.az xəbər verir ki, sentyabrın 7-də yayımlanan v4.3 versiyasında “OpenAI”ın GPT-6 Astra modeli ilə “Anthropic”in Claude Fable 5.1 modeli 53 xalla liderliyi bölüşüb.

Platformanın açıqlamasına görə, v4.1.1, v4.2 və v4.3 yeniləmələri daha genişmiqyaslı v5 versiyasından əvvəl həyata keçirilən sürətləndirilmiş dəyişikliklərdir. Süni intellekt sahəsində inkişafın yüksək templə davam etməsi səbəbindən növbəti əsas yeniləmənin gözlənilmədiyi bildirilib.

Bir həftə ərzində göstəricilər bir neçə dəfə dəyişib. GPT-6 Astra ilk dəfə qiymətləndirməyə daxil edilərkən v4.1.1 versiyasında 61 xal toplayıb. Həmin mərhələdə Claude Fable 5.1 isə 66 xalla öndə olub.

Dörd gün sonra təqdim olunan v4.2 versiyasında qiymətləndirmə sisteminə yeni meyarlar əlavə edilib və nəticələri artıq kifayət qədər fərqləndirməyən GPQA Diamond testi siyahıdan çıxarılıb. Bundan sonra Fable 5.1-in göstəricisi 57 xala, Astra-nın nəticəsi isə 55 xala düşüb.

Üç gün sonra yayımlanan v4.3 yeniləməsində isə Terminal-Bench və AutomationBench-AA testləri sistemə əlavə olunub. Nəticədə hər iki model 53 xalla eyni səviyyəyə yüksəlib.

Eyni bal modellərin real istifadədə eyni səviyyədə olması demək deyil. Qiymətləndirmədə 53 xal alan GPT-6 Astra-nın bir tapşırıq üzrə orta hesabla 3,26 dollar xərc yaratdığı halda, Claude Fable 5.1 üçün bu göstərici 7,63 dollar olub.

Beləliklə, verilən rəqəmlərə əsasən Astra eyni performans səviyyəsində tapşırıq başına təxminən 57 faiz daha aşağı xərc təqdim edib. Bu fərqin əsas səbəblərindən biri kimi Astra-nın qiymətləndirmə zamanı daha az çıxış çipi istifadə etməsi göstərilir.

Test nəticələri modellərin güclü olduğu sahələr arasında da fərq olduğunu ortaya qoyub. Claude Fable 5.1 informasiya yönümlü tapşırıqlarda və elmi hesablamalarda daha yaxşı nəticə göstərib. Astra isə terminal əsaslı proqramlaşdırma işləri və iş axınlarının avtomatlaşdırılmasında üstünlük qazanıb.

Artificial Analysis gizli testlərin payını da artırır. Modellərin testləri əzbərləməsinin qarşısını almaq məqsədilə v4.1 versiyasında 20 faiz təşkil edən gizli testlərin payı v4.2-də 40 faizə, v4.3-də isə 45 faizə çatdırılıb. Platforma v5 versiyasında bu göstəricini daha da yüksəltməyi planlaşdırır.

Hazırkı v4.3 reytinqində Astra və Fable 5.1-dən sonra Claude Opus 5 modeli 51 xalla üçüncü yerdədir. Claude Fable 5 50, Muse Spark 1.3 isə 48 xal toplayıb.

GPT-5.6 Sol modeli 47 xalla növbəti pillədə qərarlaşıb. Açıq mənbəli modellər arasında isə GLM-5.3 Flash 42 xalla lider mövqeyini tutur.




AFN.az
Redaksiyamızla əlaqə: tel; 070 372 99 90, E-mail:office@afn.az



menyu
menyu