Google представи по-рано тази седмица Gemini 4 Argon, но част от служителите ѝ твърдят, че моделът се справя зле в реална работа, особено при писане на код, отколкото показват резултатите му от тестове, съобщи Bloomberg.
В независим индекс на база тестови резултати Argon е наравно с GPT-6 Astra на OpenAI и изостава от най-новите модели на Anthropic. Колко добре се справя извън бенчмарковете знаят само избрани партньори в сферата на киберсигурността и, очевидно, вътрешните инженерни екипи на компанията.
Служители с достъп до Argon казват, че се затруднява с част от задачите по програмиране. Един от тях посочва front-end дизайна – работата, която определя как изглежда и как се усеща едно приложение или сайт. Някои смятат, че Fable на Anthropic и Astra на OpenAI се подобряват по-бързо от Gemini и че Gemini 4 ще изостава от тях в някои области. Други все пак са на мнение, че Google е догонила конкурентите.
Google поевтиня с поне $200 милиарда заради грешки в сфера, в която трябваше вече да е лидер
Новата версия на Gemini Pro препъна онлайн гиганта
Двама души, запознати с модела, казват, че той изглежда засегнат от benchmaxxing – насочване на инженерните усилия към висок резултат на тестовете за сметка на това дали продуктът върши работата на потребителя. Лабораториите правят така, защото клиентите често оценяват моделите по класациите.
„Все едно детето ми има много добър резултат на SAT, но SAT не показва как ще се представи в реалния свят. Това е изключително коварен проблем“, каза Едуин Чен, основател на AI стартъпа Surge AI, цитиран от Implicator.
Google бяха притиснати да извадят силен флагмански модел. Преди близо година излезе успешният Gemini 3, а за лятото беше анонсирана версия 3.5 Pro, която така и не излезе на фона на информации за слабо представяне при тестовете ѝ.
Google Gemini вече създава музика и Spotify страда на борсата
AI песните не са нещо ново, но сега ще станат масови
Така новото от Google през последните 7 месеца бяха няколко нови Gemini Flash модела. Макар и наистина доста добри в класа си, те си остават от „лека категория“ – при по-сложни задачи бързо си проличават лимитите на възможностите им.
Позицията на Google
Служителите, които описват недостатъците на Argon, са анонимни. Google оспорва версията им и казва, че би било неточно моделът да се определи като слаб в области като програмирането.
„Имам пълно доверие в екипа. За мен е сигурно, че винаги ще сме на фронтовата линия“, каза Корай Кавукчуоглу, който ръководи ежедневната работа на Google DeepMind от август, когато Демис Хасабис стана председател.
Към момента ситуацията е „дума срещу дума“. Достъпът все още е през програмата на Google за киберсигурност Fairwind. Следват платените клиенти на API и абонатите на Google AI Ultra, но без обявена дата.
Article source: https://money.bg/inovations/dazhe-i-programistite-v-google-ne-sa-vpechatleni-ot-novata-versiya-na-gemini.html


Discussion
No comments yet.