گوگل Flow با Veo 3.1 آپدیت شد – هوش مصنوعی جدید گوگل برای ساخت فیلم سینمایی
تا چند سال قبل ساخت یک ویدیوی سینمایی حرفه ای نیاز به دوربین های گران قیمت، تیم فیلمبرداری، بازیگر و تجهیزات پیچیده داشت؛ اما حالا هوش مصنوعی در حال تغییر کامل صنعت تولید محتوا است. گوگل با معرفی Google Flow و مدل قدرتمند Veo 3.1 قدم جدیدی در مسیر ساخت فیلم با هوش مصنوعی برداشته است؛ ابزاری که به کاربران اجازه می دهد تنها با نوشتن یک توضیح متنی یا استفاده از یک تصویر، صحنه های ویدیویی واقع گرایانه با کیفیت سینمایی تولید کنند. Google Flow در واقع یک محیط خلاقانه برای ساخت و مدیریت پروژه های ویدیویی است که با کمک مدل Veo 3.1 می تواند حرکت دوربین، جزئیات صحنه، نورپردازی، افکت های صوتی و حتی داستان پردازی را به شکل هوشمند ایجاد کند. این فناوری می تواند برای فیلمسازان، تولیدکنندگان محتوای شبکه های اجتماعی، تبلیغات، آموزش و حتی کاربران عادی که می خواهند ایده های خود را به تصویر تبدیل کنند، کاربرد داشته باشد. در این مقاله بررسی می کنیم Google Flow چیست، چه تفاوتی با Veo 3.1 دارد، چگونه می توان با آن ویدیو ساخت، چه قابلیت هایی ارائه می دهد و آیا می تواند رقیبی جدی برای ابزارهایی مانند Sora، Runway و دیگر مدل های تولید ویدیو با هوش مصنوعی باشد.
Google Flow چیست؟
Google Flow چگونه کار می کند؟
Google Flow از ترکیب چند فناوری هوش مصنوعی استفاده می کند:
| فناوری | نقش در Google Flow |
|---|---|
| Veo 3.1 | مدل اصلی تولید ویدیو که صحنه های واقعی با حرکت، نورپردازی و جزئیات سینمایی ایجاد می کند. |
| Gemini | کمک به درک ایده ها، نوشتن سناریو و تبدیل توضیحات کاربر به دستورهای دقیق. |
| Imagen | ساخت تصاویر و عناصر بصری مورد استفاده در پروژه های ویدیویی. |
Veo 3.1 چه تغییری در Google Flow ایجاد کرد؟
Veo 3.1 یکی از جدیدترین مدل های هوش مصنوعی گوگل برای تولید ویدیو است که توسط Google DeepMind توسعه داده شده و به عنوان موتور اصلی تولید محتوا در Google Flow استفاده می شود. این مدل با هدف ساده تر کردن فرآیند فیلمسازی ساخته شده تا کاربران بتوانند تنها با نوشتن یک توضیح متنی یا ارائه یک تصویر، صحنه های ویدیویی واقع گرایانه با کیفیت سینمایی ایجاد کنند. بر خلاف نسل های قدیمی تر ابزارهای تولید ویدیو با هوش مصنوعی که معمولا فقط تصاویر متحرک کوتاه تولید می کردند، Veo 3.1 تلاش می کند مفهوم کامل یک صحنه را درک کند. این مدل می تواند عناصر مختلفی مانند محیط، حرکت شخصیت ها، نورپردازی، زاویه دوربین، سبک فیلمبرداری و حتی فضای داستانی را تحلیل کند و خروجی طبیعی تری ایجاد کند. به همین دلیل Veo 3.1 فقط یک ابزار تبدیل متن به ویدیو نیست، بلکه یک دستیار هوشمند برای ساخت محتوای ویدیویی، تبلیغات، فیلم های کوتاه، محتوای شبکه های اجتماعی و پروژه های خلاقانه محسوب می شود.
مهم ترین قابلیت های Veo 3.1 :
ساخت ویدیو از متن (Text to Video)
مهم ترین قابلیت Veo 3.1 تبدیل توضیحات متنی به ویدیو است. کاربران می توانند ایده خود را با جزئیات بنویسند و مدل هوش مصنوعی گوگل بر اساس آن یک صحنه ویدیویی ایجاد کند. برای مثال:
“یک خیابان بارانی در توکیو هنگام شب، نورهای نئون روی آسفالت خیس، حرکت آرام دوربین به سمت یک خودروی اسپرت، سبک فیلم سینمایی”
در این حالت مدل تلاش می کند مواردی مانند فضای شهری، نور، حرکت دوربین و حس سینمایی صحنه را در خروجی نهایی حفظ کند.
تبدیل تصویر به ویدیو (Image to Video)
Veo 3.1 علاوه بر تولید ویدیو از متن، می تواند تصاویر ثابت را نیز به صحنه های متحرک تبدیل کند. این قابلیت کاربردهای زیادی دارد، از جمله:
✔ تبدیل طرح های اولیه به ویدیو
✔ ساخت تیزر تبلیغاتی از تصاویر محصولات
✔ متحرک کردن تصاویر هنری
✔ ایجاد حرکت برای شخصیت ها و محیط ها
✔ تولید صدا و افکت های صوتی هماهنگ با تصویر
یکی از ویژگی های مهم نسل جدید Veo، توجه بیشتر به بخش صوتی ویدیو است. این مدل می تواند در کنار تصویر، صداهای مرتبط با محیط و فضای صحنه را نیز ایجاد کند. برای مثال در یک صحنه خیابانی می تواند صداهایی مانند:
✔ صدای باران
✔ صدای خودروها
✔ صدای محیط
✔ افکت های سینمایی
را به ویدیو اضافه کند تا نتیجه نهایی طبیعی تر باشد.
کنترل حرکت دوربین و سبک فیلمبرداری
یکی از تفاوت های مهم Veo 3.1 با بسیاری از ابزارهای ساده تولید ویدیو، توانایی بهتر در درک دستورات مربوط به دوربین است. کاربر می تواند نوع فیلمبرداری را مشخص کند، مانند:
✔ حرکت آرام دوربین به سمت سوژه
✔ نمای نزدیک از چهره یا محصول
✔ حرکت هوایی شبیه فیلمبرداری با پهپاد
✔ دنبال کردن یک شخصیت در محیط
این قابلیت باعث می شود خروجی بیشتر شبیه یک سکانس واقعی فیلم باشد.
حفظ هماهنگی شخصیت ها و عناصر در چند صحنه
یکی از مشکلات مدل های قدیمی تولید ویدیو، تغییر ظاهر شخصیت ها یا جزئیات محیط در هر خروجی بود. Veo 3.1 تلاش می کند هماهنگی بیشتری بین صحنه های مختلف ایجاد کند تا کاربران بتوانند داستان های طولانی تر و پروژه های منسجم تری بسازند. این ویژگی برای تولید:
✔ فیلم کوتاه
✔ تبلیغات برندها
✔ محتوای داستانی
✔ ویدیوهای آموزشی
اهمیت زیادی دارد.
خلاصه قابلیت های Veo 3.1
| قابلیت | توضیح |
|---|---|
| Text to Video | تبدیل توضیحات متنی به ویدیوهای سینمایی با کمک هوش مصنوعی |
| Image to Video | تبدیل تصاویر ثابت به ویدیوهای متحرک |
| تولید صدا | ایجاد افکت های صوتی و صداهای هماهنگ با صحنه |
| کنترل دوربین | ایجاد حرکت های سینمایی مانند زوم، حرکت دنبال کننده و نمای هوایی |
| هماهنگی صحنه ها | حفظ بهتر شخصیت ها و عناصر داستانی در چند ویدیو |
یکی از جذاب ترین قابلیت ها: تولید صدا همراه ویدیو
Veo مدل هوش مصنوعی تولید ویدئوی گوگل است که توسط Gooیکی از چیزهایی که باعث شد Veo 3.1 بیشتر مورد توجه تولیدکنندگان محتوا قرار بگیرد، پیشرفت قابلیت Audio است. در این رویکرد، صدا فقط یک مرحله جداگانه بعد از ساخت ویدیو نیست. مدل می تواند صداهای محیطی، افکت ها و دیالوگ را در کنار تصویر تولید کند و هدف این است که صدا با اتفاقات داخل صحنه هماهنگ باشد. گوگل در به روزرسانی Flow اعلام کرد که پشتیبانی صوتی به قابلیت هایی فراتر از تولید مستقیم ویدیو گسترش پیدا کرده است. برای یک تولیدکننده محتوا این یعنی مثلا می توانید یک صحنه خیابانی بارانی تعریف کنید و از مدل بخواهید همزمان صدای باران، حرکت خودرو و دیالوگ شخصیت ها را در نظر بگیرد. البته هنوز نباید انتظار داشت که تمام خروجی ها بدون نیاز به اصلاح حرفه ای آماده انتشار باشند. برای تبلیغات جدی، فیلم کوتاه یا محتوای برند، کنترل دستی صدا همچنان ارزش زیادی دارد.gle DeepMind توسعه داده شده است. هدف اصلی Veo این است که بتواند ویدئوهایی با کیفیت بالا و نزدیک به تصاویر واقعی تولید کند. نسخه جدید Veo 3.1 تلاش می کند مشکلات رایج مدل های قبلی را کاهش دهد:
- حرکت غیر طبیعی اجسام
- تغییر چهره شخصیت ها
- ضعف در نمایش فیزیک محیط
- هماهنگ نبودن صدا و تصویر
بهبود این موارد باعث شده Google Flow برای استفاده های حرفه ای تر مناسب تر شود.
Ingredients؛ راه حل گوگل برای حفظ شخصیت و اشیا
یکی از مشکلات قدیمی ویدیوهای تولیدشده با AI، تغییر ظاهر سوژه در نماهای مختلف بود. فرض کنید یک کاراکتر با کت قرمز ساخته اید. در شات دوم ممکن است مدل چهره، لباس یا حتی جزئیات ظاهری او را تغییر دهد. برای پروژه های چندصحنه ای، این مسئله می تواند خروجی را خراب کند.
Flow با قابلیت Ingredients to Video تلاش می کند این مشکل را کاهش دهد. شما می توانید چند تصویر مرجع از شخصیت، محصول، شیء یا سبک بصری را در اختیار سیستم قرار دهید و از آنها برای کنترل بهتر نتیجه استفاده کنید. گوگل در اسناد رسمی Flow نیز این قابلیت را به عنوان یکی از حالت های پشتیبانی شده در مدل های مشخص Veo و Omni معرفی کرده است. Ingredients برای چه کسانی مهم تر است؟
- ساخت تبلیغات محصول
- ساخت شخصیت ثابت
- تولید سری ویدیوهای شبکه های اجتماعی
- ساخت داستان چندشاته
- انیمیشن و محتوای داستانی
- ساخت محتوای برند با ظاهر یکسان
برای مثال، اگر یک فروشگاه اینترنتی بخواهد از یک محصول در چند ویدیوی تبلیغاتی استفاده کند، داشتن تصویر مرجع محصول می تواند به حفظ ظاهر آن در نماهای مختلف کمک کند.
Frames to Video؛ وقتی کنترل اولین و آخرین فریم مهم است
Extend؛ ویدیو را ادامه بده، نه اینکه از اول بساز
آیا Veo 3.1 در Flow همان مدل قدیمی است؟
مدل های فعلی Flow چه تفاوتی با هم دارند؟
| مدل | مناسب برای | قابلیت های شاخص |
|---|---|---|
| Veo 3.1 Lite | تست ایده و تولید اقتصادی | Text to Video، Frames to Video، Ingredients، Extend |
| Veo 3.1 Fast | تولید سریع و آزمون و خطا | تولید سریع ویدیو، مناسب برای iteration |
| Veo 3.1 Quality | خروجی نهایی با کیفیت بالاتر | Text to Video و Frames to Video با کیفیت بالاتر |
| Gemini Omni Flash 1.1 | تولید و ویرایش چندوجهی | ویدیو ۱۰ ثانیه ای، Ingredients، ویرایش ویدیویی و قابلیت های مکالمه ای |
Gemini Omni چه چیزی به Flow اضافه کرده است؟
در به روزرسانی های جدید ۲۰۲۶، Google Flow از Gemini Omni هم بهره می برد و همین موضوع آن را از یک ابزار ساده تولید ویدیو دورتر کرده است. Omni برای کارهای چندوجهی طراحی شده؛ یعنی می تواند متن، تصویر و ویدیو را در یک workflow درک کند و در قابلیت هایی مانند ویرایش ویدیوی آپلودشده، ساخت ویدیو از تصاویر مرجع، تنظیم شات و تولید ویدیوهای ۱۰ ثانیه ای به کار رود.
Flow، Gemini Omni Flash 1.1 قابلیت هایی مانند موارد زیر دارد:
- Text to Video
- Frames to Video
- First + Last Frame
- Ingredients یا References
- Video to Video Editing
- تولید کلیپ های ۱۰ ثانیه ای
- تولید در وضوح ۳۶۰p با هزینه اعتباری کمتر
- Upscale برخی خروجی ها
- ویرایش ویدیوی تولیدشده یا آپلودشده
Flow در سال ۲۰۲۶ فقط ابزار ساخت ویدیو نیست

مطالب زیر را حتما بخوانید
-
Claude Fable 5.1 چیست؟ معرفی مدل جدید هوش مصنوعی آنتروپیک
65 بازدید
-
معرفی جمنای 3.8 – بررسی Gemini 3.8 کامل جدیدترین مدل هوش مصنوعی گوگل
155 بازدید
-
GPT-6 Astra معرفی شد – نسل جدید هوش مصنوعی OpenAI
167 بازدید
-
AI Mode گوگل چیست؟ قابلیت جدید گوگل که آینده جستجو را تغییر میدهد!
189 بازدید
-
Google Pics چیست؟ معرفی ابزار جدید هوش مصنوعی گوگل برای طراحی و ویرایش تصویر
216 بازدید
-
هوش مصنوعی جدید Wan 3.0 چیست؟
329 بازدید
دیدگاهتان را بنویسید