پرش به محتوای اصلی
تاپ گیفت
هوش مصنوعی

ساخت تصویر با هوش مصنوعی؛ راهنمای عملی نوشتن پرامپت تصویری

یک نمونه واقعی از خروجی مدل تصویری، پنج چیزی که باید در درخواست بگویید، و محدودیت‌هایی مثل متن فارسی که داخل تصویر خوانا درنمی‌آید.

نویسنده: تاپ‌گیفت
7 دقیقه مطالعه
ساخت تصویر با هوش مصنوعی؛ راهنمای عملی نوشتن پرامپت تصویری

ساخت تصویر با هوش مصنوعی ساده‌تر از چیزی است که به نظر می‌رسد: یک جمله می‌نویسید و چند ثانیه بعد تصویری دارید که قبلاً وجود نداشت. کاری که سخت‌تر است، گرفتن همان تصویری است که در ذهن داشتید.

در این راهنما دو تصویر واقعی را کنار هم می‌گذاریم: یکی از یک درخواست چهارکلمه‌ای و یکی از یک درخواست دقیق. هر دو با یک مدل و در یک روز ساخته شده‌اند، پس تفاوتشان فقط به متن درخواست برمی‌گردد. محدودیت‌های واقعی این مدل‌ها را هم بدون تعارف می‌گوییم.

یک نمونه واقعی با ساده‌ترین درخواست ممکن

این درخواست را دادیم: «یک تصویر از یک کافه». نه سبک گفتیم، نه زاویه دوربین، نه نور، نه اینکه داخل باشد یا بیرون. نتیجه در حدود 4 ثانیه آماده شد:

تصویر ساخته‌شده با هوش مصنوعی از فضای داخلی یک کافه با میزهای چوبی و مشتریانی پشت لپ‌تاپ

خروجی واقعی مدل Nano Banana 2 Lite در تاپ‌گیفت AI، تاریخ 1405/06/29، نسبت تصویر 16:9.

نتیجه برای یک درخواست چهارکلمه‌ای خوب است: فضای داخلی یک کافه، نور طبیعی از پنجره، میزهای چوبی، آدم‌هایی که پشت لپ‌تاپ نشسته‌اند. مدل خودش تصمیم گرفته که کافه ایرانی باشد، ساعت روز باشد و شلوغ باشد — هیچ‌کدام را ما نگفته بودیم.

حالا به جزئیات نگاه کنید

اگر تصویر را بزرگ کنید، دو چیز را می‌بینید که در بیشتر تصاویر ساخته‌شده با هوش مصنوعی تکرار می‌شود:

  • متن روی تخته‌سیاه منو بی‌معنی است. حروف شبیه فارسی‌اند ولی کلمه نیستند. مدل‌های تصویری متن را مثل الگوی تصویری یاد می‌گیرند، نه مثل زبان؛ به همین دلیل متن فارسی داخل تصویر تقریباً همیشه خراب درمی‌آید.

  • جزئیات دست و شیء در حاشیه تصویر دقیق نیستند. هرچه از مرکز تصویر دورتر شوید، احتمال خطا در جزئیات بیشتر می‌شود.

این دو محدودیت مهم‌اند چون تعیین می‌کنند تصویر ساخته‌شده کجا به کار می‌آید و کجا نه. برای فضاسازی و تصویر پس‌زمینه عالی است؛ برای پوستری که باید متن فارسی خوانا داشته باشد، نه — متن را باید بعداً خودتان روی تصویر بگذارید.

یک درخواست تصویری خوب چه چیزهایی دارد؟

هرچه بیشتر بگویید، مدل کمتر حدس می‌زند. این پنج چیز بیشترین اثر را دارند:

1. موضوع مشخص

«یک کافه» در برابر «فضای داخلی یک کافه کوچک با پنجره بزرگ رو به خیابان و دو میز چوبی». هرچه موضوع دقیق‌تر باشد، شانس اینکه چیزی بگیرید که می‌خواستید بیشتر است.

2. سبک

عکاسی واقع‌گرایانه، تصویرسازی تخت، نقاشی آبرنگ، رندر سه‌بعدی؟ اگر نگویید، مدل معمولاً عکاسی واقع‌گرایانه را انتخاب می‌کند.

3. نور و فضا

نور طبیعی صبح، نور گرم عصر، فضای کم‌نور با چراغ‌های نقطه‌ای. نور بیشتر از هر چیز دیگری حال‌وهوای تصویر را می‌سازد.

4. ترکیب‌بندی و زاویه

نمای نزدیک، نمای باز، از بالا، هم‌سطح چشم. اگر تصویر قرار است جایی مثل کاور یا بنر استفاده شود، بگویید کجای تصویر باید خالی بماند تا بعداً متن رویش بنشیند.

5. آنچه نمی‌خواهید

«بدون آدم»، «بدون متن»، «بدون لوگو». گفتن چیزهای ناخواسته معمولاً مؤثرتر از توضیح دادن چیزهای خواسته است.

یک نکته عملی: به‌جای نوشتن یک پاراگراف طولانی، این موارد را پشت سر هم و با ویرگول بنویسید. مدل‌های تصویری به فهرست ویژگی‌ها بهتر جواب می‌دهند تا به جمله‌های داستانی.

همان صحنه، این بار با یک درخواست دقیق

حالا همان کافه را با درخواستی خواستیم که هر پنج مورد بالا را داشت:

فضای داخلی یک کافه کوچک محله‌ای، نمای هم‌سطح چشم از گوشه سالن، یک میز چوبی روشن در پیش‌زمینه با یک فنجان قهوه و یک دفترچه بسته، پنجره بزرگ در سمت راست با نور ملایم صبح، رنگ‌های گرم و آرام، عکاسی واقع‌گرایانه با عمق میدان کم، بدون آدم، بدون هیچ متن و نوشته‌ای، بدون لوگو، سمت چپ تصویر خلوت بماند

تصویر ساخته‌شده با هوش مصنوعی از گوشه یک کافه با میز چوبی، فنجان قهوه و دفترچه کنار پنجره، بدون حضور آدم

خروجی واقعی همان مدل، همان روز، همان نسبت تصویر 16:9.

چهار تفاوتی که مستقیماً از متن درخواست آمده‌اند:

  • هیچ آدمی در تصویر نیست. تصویر اول پر از آدم بود، چون چیزی نگفته بودیم؛ این‌بار «بدون آدم» را خواستیم.

  • هیچ متن بی‌معنایی در تصویر نیست. با حذف تخته‌سیاه و منو، آن مشکل همیشگی متن فارسی هم حذف شد. این ساده‌ترین راه دورزدن آن محدودیت است: متن را از صحنه بیرون بگذارید.

  • سوژه مشخص در پیش‌زمینه. میز چوبی با فنجان و دفترچه، همان چیزی که خواسته بودیم؛ در تصویر اول هیچ سوژه مشخصی وجود نداشت و چشم جایی برای نشستن نداشت.

  • جای خالی برای متن. چون گفته بودیم سمت چپ خلوت بماند، حالا می‌شود روی آن بخش عنوان یا لوگو گذاشت. این نکته برای کاور، بنر و تصویر شاخص مقاله تفاوت بزرگی می‌سازد.

هر دو تصویر را یک مدل ساخته و هزینه‌شان هم یکسان بوده است. تنها چیزی که فرق کرده، متنی است که نوشته‌ایم.

یک نکته منصفانه: تصویر دوم لزوماً «بهتر» نیست، بلکه نزدیک‌تر به چیزی است که خواسته بودیم. اگر واقعاً به تصویری از یک کافه شلوغ و پرجنب‌وجوش نیاز داشتید، تصویر اول جواب بهتری بود. هدف درخواست دقیق، کنترل است، نه زیبایی بیشتر.

اگر نتیجه آن چیزی نبود که می‌خواستید

  • یک چیز را در هر تلاش عوض کنید. اگر هم‌زمان سبک و نور و زاویه را تغییر دهید، نمی‌فهمید کدام تغییر مؤثر بوده.

  • دوباره بسازید. همان درخواست، بار دوم نتیجه متفاوتی می‌دهد؛ گاهی همین کافی است.

  • توقع متن خوانا نداشته باشید. اگر متن لازم دارید، تصویر را بدون متن بسازید و نوشته را با یک ابزار ساده رویش بگذارید.

هزینه و محدودیت‌ها را جدی بگیرید

ساخت تصویر معمولاً از یک پاسخ متنی گران‌تر است. در تاپ‌گیفت، مصرف اعتبار هر درخواست به مدل و قابلیتی که استفاده می‌کنید بستگی دارد و مدل‌های تصویری با هم فرق دارند؛ فهرست مدل‌ها و پلن‌ها در جدول پلن‌ها و مدل‌های تاپ‌گیفت AI آمده است. تصویر این مقاله با مدل اقتصادی تصویری ساخته شد که برای حساب‌های بدون اشتراک هم فعال است.

تصویرهایی که می‌سازید در حساب خودتان می‌مانند و هر زمان می‌توانید دوباره ببینید یا دانلودشان کنید.

چند نکته حقوقی و اخلاقی که بهتر است بدانید

  • چهره افراد واقعی را نسازید. ساختن تصویر از یک شخص مشخص، بدون اجازه او، هم مسئله حقوقی دارد و هم اخلاقی.

  • تصویر ساخته‌شده را به‌عنوان عکس واقعی جا نزنید. اگر تصویر در خبر، گزارش یا محتوای مستند استفاده می‌شود، بنویسید که ساخته هوش مصنوعی است — همان کاری که در همین مقاله کردیم.

  • مراقب برند و اثر دیگران باشید. درخواست «به سبک فلان هنرمند زنده» یا ساختن لوگوی شبیه یک برند شناخته‌شده، شما را در موقعیت پرریسکی می‌گذارد.

جمع‌بندی

یک درخواست کوتاه، تصویر قابل‌قبولی می‌دهد؛ اما تصویری که دقیقاً به کار شما بیاید، از درخواستی می‌آید که موضوع، سبک، نور، ترکیب‌بندی و چیزهای ناخواسته را مشخص کرده باشد. محدودیت‌ها را هم بشناسید: متن فارسی داخل تصویر هنوز قابل اتکا نیست.

برای تمرین، دقیقاً همین کار را انجام دهید: یک تصویر با یک جمله کوتاه بسازید، بعد همان صحنه را با موضوع، سبک، نور، ترکیب‌بندی و موارد ناخواسته دوباره بخواهید و دو نتیجه را کنار هم بگذارید. اگر با نوشتن درخواست راحت نیستید، راهنمای سؤال‌پرسیدن از هوش مصنوعی نقطه شروع خوبی است؛ و برای شروع کار می‌توانید از اعتبار هدیه تاپ‌گیفت AI استفاده کنید.

پرسش‌های متداول

چرا متن فارسی داخل تصویر ساخته‌شده خوانا نیست؟
مدل‌های تصویری متن را مثل الگوی تصویری یاد می‌گیرند نه مثل زبان. به همین دلیل حروف شبیه فارسی درمی‌آیند ولی کلمه نیستند. راه‌حل عملی این است که تصویر را بدون متن بسازید و نوشته را بعداً رویش بگذارید.
یک درخواست تصویری خوب چه چیزهایی دارد؟
موضوع مشخص، سبک، نور و فضا، ترکیب‌بندی و زاویه، و آنچه نمی‌خواهید. نوشتن این موارد پشت سر هم و با ویرگول، بهتر از یک پاراگراف داستانی جواب می‌دهد.
تصویرهایی که می‌سازم کجا می‌مانند؟
در حساب کاربری خودتان می‌مانند و هر زمان می‌توانید دوباره ببینید یا دانلودشان کنید.
اشتراک‌گذاری: اشتراک در تلگرام

مقالات مرتبط