به گزارش خبرگزاری بیکینگ، بااینحال، ساخت یک ویدیوی قابل استفاده با هوش مصنوعی فقط به نوشتن یک جمله و فشردن یک دکمه محدود نمیشود. تولیدکننده باید ایده را به صحنههای کوچک تقسیم کند، برای هر نما پرامپت دقیقی بنویسد، خروجیها را بررسی کند و در نهایت، تصویر، صدا، موسیقی و تدوین را در کنار هم قرار دهد.
ویدیوسازهای هوش مصنوعی چه کارهایی انجام میدهند؟
مدلهای مولد ویدیو میتوانند متن یا تصویر را به کلیپ تبدیل کنند، حرکت سوژه و دوربین را شبیهسازی کنند و در برخی نسخهها، صدا، گفتوگو و موسیقی را نیز به ویدیو اضافه کنند.
ابزارهای جدیدی مانند Veo، Runway، Kling و Luma برای تولید ویدیو از متن و تصویر، ساخت نماهای سینمایی، متحرککردن عکسهای ثابت و ویرایش ویدیو به کار میروند. قابلیتهای این سرویسها بهسرعت تغییر میکند؛ بنابراین پیش از استفاده، باید امکانات نسخه فعلی، هزینه، محدودیتهای دسترسی و شرایط استفاده تجاری هر ابزار بررسی شود.
با چه ابزارهایی میتوان با هوش مصنوعی ویدیو ساخت؟
Google Veo
Veo برای تولید ویدیو از متن و تصویر کاربرد دارد و بر واقعگرایی، درک بهتر پرامپت، کنترل خلاقانه و تولید ویدیو همراه با صدا تمرکز کرده است.
از این ابزار میتوان برای ساخت نماهای کوتاه، ویدیوهای تبلیغاتی، محتوای شبکههای اجتماعی و بازسازی تصویری ایدههای داستانی استفاده کرد.
Runway
Runway مجموعهای از ابزارهای تولید و ویرایش ویدیو را ارائه میدهد. کاربران میتوانند با استفاده از متن یا تصویر، کلیپ بسازند و ویژگیهایی مانند حرکت دوربین، ظاهر نما و حرکت سوژه را کنترل کنند.
این ابزار برای تولید نماهای سینمایی، آزمودن ایدههای بصری و اصلاح ویدیوهای موجود مورد استفاده قرار میگیرد.
Kling
Kling یکی از ابزارهای مطرح تولید ویدیو از متن و تصویر است. این سرویس برای ساخت نماهای چندبخشی، نمایش حرکتهای پیچیده و تولید برخی عناصر صوتی کاربرد دارد.
Kling در بعضی محیطهای تولید محتوای خلاقانه، ازجمله Adobe Firefly، نیز ارائه شده است.
Luma AI و Ray
ابزارهای Luma برای جانبخشیدن به تصاویر ثابت، شبیهسازی حرکت دوربین و حفظ تداوم سوژه در نماهای مختلف کاربرد دارند.
این سرویسها برای تبدیل یک تصویر مفهومی به نمایی متحرک، ساخت تیزر کوتاه و تولید محتوای بصری شبکههای اجتماعی مناسب هستند.
Adobe Firefly Video
Adobe Firefly محیطی برای تولید و اصلاح محتوای خلاقانه است. این محیط علاوه بر مدل اختصاصی Adobe، در برخی قابلیتها امکان استفاده از مدلهای شریک را نیز فراهم میکند.
مزیت چنین رویکردی، امکان مقایسه خروجی چند مدل و اصلاح ویدیو در یک جریان کاری واحد است.
Gemini
Gemini در اکوسیستم گوگل، به برخی قابلیتهای تولید ویدیو مانند Veo دسترسی میدهد. کاربر ممکن است بهجای مراجعه مستقیم به محیط تخصصی ویدیو، از مسیر Gemini به تولید کلیپ برسد.
قابلیتهای دقیق Gemini به نوع حساب کاربری، نسخه مدل و سرویس مورد استفاده بستگی دارد.
تفاوت Text-to-Video و Image-to-Video چیست؟
دو روش اصلی برای ساخت ویدیو با هوش مصنوعی وجود دارد:
تولید ویدیو از متن؛ Text-to-Video
در این روش، کاربر صحنه مورد نظر خود را با کلمات توصیف میکند و مدل براساس آن، یک کلیپ میسازد.
نمونه پرامپت:
خیابانی بارانی در تهران هنگام غروب؛ نور چراغ خودروها روی آسفالت خیس منعکس شده است؛ دوربین بهآرامی به سمت عابری با چتر قرمز حرکت میکند؛ سبک واقعگرایانه و سینمایی، نورپردازی طبیعی، فضای آرام و کمی رازآلود.
این روش برای زمانی مناسب است که کاربر هنوز تصویر اولیهای ندارد و میخواهد صحنه را از ابتدا طراحی کند.
تولید ویدیو از تصویر؛ Image-to-Video
در این روش، ابتدا یک تصویر مرجع در اختیار مدل قرار میگیرد و سپس کاربر از آن میخواهد تصویر را متحرک کند.
نمونه پرامپت:
عابر بهآرامی راه میرود، چتر قرمز با وزش باد کمی حرکت میکند، قطرات باران در نور چراغها دیده میشوند و دوربین با حرکتی نرم از کنار او عبور میکند.
Image-to-Video زمانی کاربردیتر است که ظاهر شخصیت، لباس، محیط یا ترکیببندی صحنه از قبل مشخص شده باشد.
فرمول نوشتن پرامپت ویدیو
برای شروع میتوان از این ساختار استفاده کرد:
سوژه + محیط + کنش + حرکت محیط + حرکت دوربین + نور + سبک + حالوهوا + نسبت تصویر
برای مثال:
گربهای سیاه روی پشتبام خانهای قدیمی در تهران هنگام غروب آرام راه میرود؛ باد ملایم موهایش را حرکت میدهد؛ دوربین با تراکینگ نرم از کنار گربه عبور میکند؛ نور طلایی و سایههای بلند؛ سبک واقعگرایانه و سینمایی؛ فضای آرام و کمی مرموز؛ نسبت تصویر ۱۶:۹.
در تولید ویدیو، برخلاف تصویر ثابت، باید درباره زمان و حرکت نیز دستور بدهید. یک جمله مانند «مردی کنار دریا ایستاده است» برای تولید تصویر مناسب است، اما برای ویدیو اطلاعات کافی ندارد.
نسخه کاملتر:
مردی کنار دریا ایستاده است؛ باد آرام پیراهنش را حرکت میدهد؛ موجها به ساحل نزدیک میشوند؛ دوربین از نمای باز بهآرامی به نمای متوسط میرسد.
در این مثال، حرکت شخصیت، حرکت محیط و حرکت دوربین مشخص شده است.
چگونه پرامپت حرفهایتر بنویسیم؟
برای رسیدن به خروجی بهتر، چند نکته اهمیت دارد:
۱. حرکتها را ساده نگه دارید
اگر در یک شات، حرکت شخصیت، حرکت چند شیء، تغییر نور، چرخش دوربین و چند رویداد همزمان تعریف شود، احتمال بیثباتی تصویر افزایش پیدا میکند.
در نخستین تلاش، یک یا دو حرکت اصلی را مشخص کنید و پس از بررسی نتیجه، جزئیات بیشتری اضافه کنید.
۲. زاویه و نوع نما را مشخص کنید
عبارتهایی مانند «نمای باز»، «نمای متوسط»، «کلوزآپ»، «نمای از بالا» یا «حرکت تراکینگ» به مدل کمک میکنند جایگاه دوربین را بهتر درک کند.
برای مثال:
کلوزآپ از دست دختر که نامه قدیمی را باز میکند؛ حرکت آرام دوربین به سمت کاغذ؛ نور گرم چراغ ایستگاه؛ فضای رازآلود.
۳. زمان و نور را بنویسید
زمان روز، وضعیت آبوهوا و نوع نور تأثیر زیادی بر نتیجه دارند:
- صبح مهآلود؛
- غروب با نور طلایی؛
- شب بارانی؛
- نور سرد مهتاب؛
- نورپردازی استودیویی؛
- سایههای بلند و کنتراست بالا.
۴. سبک تصویری را مشخص کنید
در صورت نیاز، سبک مورد نظر را نیز بنویسید:
- واقعگرایانه؛
- مستندگونه؛
- سینمایی؛
- انیمیشن سهبعدی؛
- فانتزی؛
- نقاشی متحرک؛
- نوآر؛
- تبلیغاتی و لوکس.
۵. از دستورهای منفی استفاده کنید
برخی ابزارها امکان استفاده از دستورهای منفی را دارند. در این بخش میتوان موارد ناخواسته را مشخص کرد:
بدون تغییر چهره، بدون دستهای اضافی، بدون نوشته ناخوانا، بدون حرکت دوربین لرزان، بدون تغییر لباس.
این دستورها همیشه بهطور کامل از خطا جلوگیری نمیکنند، اما میتوانند احتمال بروز برخی مشکلات را کاهش دهند.
ساخت فیلم کوتاه با هوش مصنوعی؛ شاتبهشات
بهتر است یک فیلم کامل را در یک مرحله تولید نکنید. فیلم را به نماهای کوتاه تقسیم کنید.
برای داستان دختری که در ایستگاه قطار نامهای قدیمی پیدا میکند، میتوان چنین شاتلیستی ساخت:
- نمای بیرونی ایستگاه قطار در غروب؛
- ورود دختر به سالن انتظار؛
- حرکت دختر در کنار نیمکتها؛
- پیدا کردن نامه روی یک نیمکت قدیمی؛
- نمای نزدیک از دست و نامه؛
- واکنش چهره دختر؛
- نگاهکردن او به قطار در حال حرکت؛
- پایان صحنه با باقیماندن نامه در دست دختر.
هر شات را جداگانه تولید و سپس در نرمافزار تدوین کنار شاتهای دیگر قرار دهید.
این روش دو مزیت دارد: اگر یک نما مشکل داشته باشد، فقط همان نما دوباره تولید میشود و کنترل بیشتری بر ریتم و روایت فیلم خواهید داشت.
چگونه شخصیت را در شاتهای مختلف ثابت نگه داریم؟
یکی از چالشهای اصلی ساخت فیلم با هوش مصنوعی، حفظ هویت شخصیت در نماهای مختلف است. ممکن است مدل در یک شات، موهای شخصیت را بلند و مشکی نشان دهد و در شات بعد، همان شخصیت را با موهای کوتاه یا لباس متفاوت تولید کند.
برای کاهش این مشکل، مشخصات شخصیت را در همه پرامپتها ثابت نگه دارید:
زن ۲۸ ساله، موهای مشکی تا روی شانه، کت بلند خاکستری، شال زرشکی، چهره طبیعی، کیف چرمی قهوهای.
همین توصیف را در شاتهای مختلف تکرار کنید. اگر ابزار امکان استفاده از تصویر مرجع، تصویر شخصیت یا قفلکردن چهره را دارد، از آن قابلیت استفاده کنید.
همچنین بهتر است یک «برگه مشخصات شخصیت» تهیه کنید و ویژگیهای زیر را در آن بنویسید:
- سن تقریبی؛
- رنگ و مدل مو؛
- لباس؛
- رنگ چشم؛
- لوازم همراه؛
- ویژگیهای چهره؛
- حالت و زبان بدن.
صدا، دیالوگ و موسیقی در ویدیوی تولیدشده با هوش مصنوعی
یک فیلم فقط تصویر نیست. صدا، گفتوگو، موسیقی، افکت و تدوین نیز بخش مهمی از تجربه مخاطب را تشکیل میدهند.
برخی مدلهای جدید ویدیویی میتوانند صدای محیط، افکت و گفتوگو را همراه تصویر تولید کنند. بااینحال، در یک پروژه جدی بهتر است صدا را نیز مانند تصویر بررسی و در صورت نیاز جداگانه اصلاح کنید.
برای مثال، ممکن است تصویر یک ایستگاه قطار مناسب باشد، اما صدای قطار، گفتوگوی شخصیت یا صدای محیط با حرکت تصویر هماهنگ نباشد. در چنین شرایطی، تولید یا ویرایش جداگانه صدا نتیجه بهتری به همراه دارد.
ساخت موسیقی فیلم با هوش مصنوعی
برای ساخت موسیقی متن، لزوما به دانش تخصصی آهنگسازی نیاز نیست. ابزارهای تولید موسیقی میتوانند براساس سبک، حالوهوا، سازبندی و مدتزمان، قطعهای متناسب با پروژه بسازند.
Suno
Suno از ابزارهای شناختهشده ساخت موسیقی با هوش مصنوعی است. کاربر میتواند سبک، فضای احساسی، موضوع و نوع قطعه را مشخص کند و آهنگی همراه با وکال و ترانه یا نسخهای بیکلام دریافت کند.
نمونه پرامپت موسیقی:
موسیقی سینمایی آرام و رازآلود، پیانوی مینیمال، استرینگهای نرم، شروع خلوت، افزایش تدریجی تنش در میانه و پایان آرام، بدون وکال.
ElevenMusic
ElevenMusic برای تولید، بازآفرینی و ویرایش موسیقی توسعه یافته است و امکان کنترل بیشتر بر وکال، سازبندی، ساختار قطعه و ترکیب ژانرها را فراهم میکند.
پیش از استفاده تجاری از موسیقی تولیدشده، شرایط حقوقی و نوع مجوز سرویس مربوط را بررسی کنید.
ساخت صدا و دوبله با هوش مصنوعی
ابزارهای صوتی هوش مصنوعی برای تولید گویندگی، دوبله، افکت صوتی، ترجمه صوتی و تولید محتوای چندزبانه کاربرد دارند.
این ابزارها میتوانند برای موارد زیر مفید باشند:
- ویدیوهای آموزشی؛
- پادکست؛
- تبلیغات؛
- کتاب صوتی؛
- دوبله محتوای خارجی؛
- تولید نسخههای چندزبانه یک ویدیو.
استفاده از صدای افراد واقعی موضوعی حساس است. برای شبیهسازی صدای شخص دیگر باید رضایت و مجوز لازم را داشته باشید. در تولید محتوای خبری نیز نباید صدای مصنوعی بهگونهای استفاده شود که مخاطب درباره هویت گوینده یا واقعیبودن یک مصاحبه دچار اشتباه شود.
چرا برخی ویدیوهای هوش مصنوعی مصنوعی به نظر میرسند؟
خطاهای رایج در ویدیوهای تولیدشده با هوش مصنوعی عبارتاند از:
- دستها و انگشتان غیرطبیعی؛
- تغییر چهره در طول نما؛
- تغییر شکل اشیا؛
- نوشتههای ناخوانا؛
- سایههای ناسازگار؛
- حرکت غیرمنطقی دوربین؛
- پرش در حرکت شخصیت؛
- ناهماهنگی صدا و تصویر؛
- تغییر لباس یا رنگ محیط.
راهحل، همیشه طولانیترکردن پرامپت نیست. ابتدا باید علت مشکل مشخص شود. اگر دست شخصیت خراب شده است، حرکت دست را سادهتر کنید. اگر دوربین ناپایدار است، حرکت آن را کاهش دهید. اگر چهره تغییر میکند، از تصویر مرجع یا توصیف ثابت شخصیت استفاده کنید.
انتخاب نسبت تصویر برای شبکههای اجتماعی
پیش از تولید ویدیو، مقصد آن را مشخص کنید.
- برای ویدیوهای افقی، نسبت ۱۶:۹ کاربرد بیشتری دارد؛
- برای ویدیوهای عمودی شبکههای اجتماعی، نسبت ۹:۱۶ مناسبتر است؛
- برای برخی پستهای مربعی، نسبت ۱:۱ قابل استفاده است.
ساخت ویدیوی افقی و بریدن آن برای نمایش عمودی ممکن است بخش مهمی از تصویر را حذف کند. بهتر است نسبت تصویر از ابتدا براساس پلتفرم مقصد انتخاب شود.
اشتباههای رایج در ساخت ویدیو با هوش مصنوعی
پرامپت بیش از حد شلوغ
قرار دادن دهها اتفاق در یک شات باعث میشود مدل نتواند اولویتهای صحنه را درست تشخیص دهد.
تغییر مشخصات شخصیت
اگر ظاهر شخصیت در هر شات تغییر کند، پیوستگی فیلم از بین میرود.
نادیدهگرفتن صدا
ویدیوی خوب بدون صدای مناسب ممکن است ناقص و غیرحرفهای به نظر برسد.
ساخت فیلم کامل در یک مرحله
تولید یک فیلم کامل با یک دستور معمولا کنترل کمی بر روایت، تداوم شخصیت و کیفیت هر نما ایجاد میکند.
انتشار بدون بازبینی
هر کلیپ را پیش از استفاده نهایی بررسی کنید. خطاهای تصویری، صوتی، حقوقی و محتوایی ممکن است در نگاه اول دیده نشوند.
حق نشر و تفاوت بازسازی با فیلم واقعی
استفاده از تصویر، چهره، صدا یا موسیقی دیگران بدون توجه به حقوق آنها میتواند پیامدهای حقوقی داشته باشد.
در محتوای خبری، باید میان فیلم واقعی، بازسازی تصویری و محتوای تولیدشده با هوش مصنوعی تفاوتی روشن وجود داشته باشد. اگر برای توضیح یک رویداد واقعی، ویدیوی مصنوعی تولید میشود، بهتر است صراحتا به مخاطب اعلام شود که این اثر «تصویرسازی» یا «بازسازی» است و فیلم واقعی محل وقوع رویداد نیست.
مسیر پیشنهادی برای ساخت یک ویدیوی کوتاه
برای شروع میتوان این فرایند را دنبال کرد:
ایده → فیلمنامه کوتاه → شاتلیست → طراحی شخصیت → تصویر مرجع → پرامپت هر شات → تولید چند نسخه → انتخاب بهترین خروجی → تولید صدا و موسیقی → تدوین → بازبینی نهایی
در مرحله تدوین، میتوان کلیپها را به یکدیگر متصل کرد، زمان هر نما را تنظیم کرد، صدا و موسیقی را روی تصویر قرار داد، زیرنویس اضافه کرد و خروجی نهایی را برای پلتفرم مورد نظر آماده کرد.
جمعبندی
ساخت ویدیو با هوش مصنوعی از یک ایده ساده آغاز میشود، اما برای رسیدن به نتیجهای قابل استفاده، به برنامهریزی و کنترل دقیق نیاز دارد. انتخاب ابزار مناسب، نوشتن پرامپت روشن، تقسیم فیلم به شاتهای کوتاه، حفظ ثبات شخصیت، توجه به صدا و بازبینی نهایی، مهمترین مراحل این فرایند هستند.
هوش مصنوعی میتواند تصویر و حرکت را تولید کند، اما همچنان این سازنده است که باید درباره جایگاه دوربین، رفتار شخصیت، فضای صحنه، ریتم روایت و دلیل حضور هر نما تصمیم بگیرد. ساخت فیلم با هوش مصنوعی بیشتر از آنکه مسابقه نوشتن طولانیترین پرامپت باشد، به معنای کنترل روایت و استفاده هوشمندانه از ابزارهاست.
57
















