به گزارش چابک آنلاین، گوگل قابلیت جدیدی به نام درک ایجنتی ویدیو (Agentic Video Understanding) را به مدلهای جدید جمینای اضافه کرد تا این مدلها ویدیوهای طولانی را با دقت بیشتری تحلیل کنند و همچنین مصرف توکن و هزینه پردازش را کاهش دهند.
این قابلیت درحالحاضر برای جمینای ۳.۶ فلش، جمینای ۳.۷ فلش و جمینای ۳.۵ لایت-فلش ارائه شده است. به گفته گوگل، استفاده از درک ایجنتی ویدیو میتواند مصرف توکن را تا ۸۸ درصد و هزینه تحلیل ویدیو را تا ۶۶ درصد کاهش دهد و در برخی معیارهای ارزیابی، دقت را تا ۷ درصد افزایش دهد.
قابلیت جدید تحلیل ویدیو در جمینای گوگل
کاربران مدتی است که میتوانند ویدیوها را در جمینای بارگذاری کنند، اما روش قبلی تحلیل ویدیو بر پردازش ثابت متکی بود. در این روش، هوش مصنوعی ویدیو را با نرخ مشخصی از فریمها (بهصورت پیشفرض یک فریم در ثانیه) دریافت میکرد. این رویکرد در ویدیوهای طولانی میتوانست به مصرف بیشتر توکن و هزینه بالاتر منجر شود و بعضی جزئیات مهم را از دست بدهد.
در روش جدید، جمینای میتواند خودش تصمیم بگیرد کدام بخشهای ویدیو را ببیند، با چه سرعتی آنها را بررسی کند و برای تحلیل هر بخش از کدام منبع استفاده کند. این منابع شامل فریمهای ویدیو، صدای ضبطشده و متن پیادهسازیشده گفتار هستند.
گوگل میگوید این فرایند به جمینای اجازه میدهد فقط بخشها و اطلاعات موردنیاز برای پاسخ به درخواست را دریافت و بررسی کند. مدل در یک فرایند ایجنتمحور میتواند ابزار داخلی خود را برای بارگذاری قسمت مرتبطی از فایل ویدیو فراخوانی کند.
قابلیت Agentic Video Understanding درحالحاضر برای ویدیوهای بارگذاریشده و ویدیوهای یوتوب از طریق Gemini API در Google AI Studio و Gemini Enterprise Agent Platform در دسترس است.
گوگل اعلام کرده این قابلیت بهزودی به اپلیکیشن جمینای نیز اضافه خواهد شد. این شرکت همچنین قصد دارد از این قابلیت در Ask YouTube استفاده کند تا این ویژگی بتواند به سازندگان محتوا در تحلیل ویدیوهایشان با جمینای کمک کند.