20#include "llvm/IR/IntrinsicsAMDGPU.h"
24#define DEBUG_TYPE "amdgpu-lower-intrinsics"
30class AMDGPULowerIntrinsicsImpl {
47class AMDGPULowerIntrinsicsLegacy :
public ModulePass {
51 AMDGPULowerIntrinsicsLegacy() :
ModulePass(ID) {}
53 bool runOnModule(
Module &M)
override;
69bool AMDGPULowerIntrinsicsImpl::run() {
73 switch (
F.getIntrinsicID()) {
76 case Intrinsic::amdgcn_s_barrier:
77 case Intrinsic::amdgcn_s_barrier_signal:
78 case Intrinsic::amdgcn_s_barrier_signal_isfirst:
79 case Intrinsic::amdgcn_s_barrier_wait:
80 case Intrinsic::amdgcn_s_cluster_barrier:
83 case Intrinsic::amdgcn_ptr_s_buffer_load:
85 F, [&](IntrinsicInst *
II) {
Changed |= visitPtrSBufferLoad(*
II); });
87 case Intrinsic::amdgcn_s_monitor_sleep:
89 F, [&](IntrinsicInst *
II) {
Changed |= visitMonitorSleep(*
II); });
91 case Intrinsic::amdgcn_cvt_scale_pk8_f16_fp8:
92 case Intrinsic::amdgcn_cvt_scale_pk8_bf16_fp8:
93 case Intrinsic::amdgcn_cvt_scale_pk8_f16_bf8:
94 case Intrinsic::amdgcn_cvt_scale_pk8_bf16_bf8:
95 case Intrinsic::amdgcn_cvt_scale_pk8_f16_fp4:
96 case Intrinsic::amdgcn_cvt_scale_pk8_bf16_fp4:
97 case Intrinsic::amdgcn_cvt_scale_pk8_f32_fp8:
98 case Intrinsic::amdgcn_cvt_scale_pk8_f32_bf8:
99 case Intrinsic::amdgcn_cvt_scale_pk8_f32_fp4:
100 case Intrinsic::amdgcn_cvt_scale_pk16_f16_bf6:
101 case Intrinsic::amdgcn_cvt_scale_pk16_bf16_bf6:
102 case Intrinsic::amdgcn_cvt_scale_pk16_f16_fp6:
103 case Intrinsic::amdgcn_cvt_scale_pk16_bf16_fp6:
104 case Intrinsic::amdgcn_cvt_scale_pk16_f32_fp6:
105 case Intrinsic::amdgcn_cvt_scale_pk16_f32_bf6:
116bool AMDGPULowerIntrinsicsImpl::visitBarrier(IntrinsicInst &
I) {
117 assert(
I.getIntrinsicID() == Intrinsic::amdgcn_s_barrier ||
118 I.getIntrinsicID() == Intrinsic::amdgcn_s_barrier_signal ||
119 I.getIntrinsicID() == Intrinsic::amdgcn_s_barrier_signal_isfirst ||
120 I.getIntrinsicID() == Intrinsic::amdgcn_s_barrier_wait ||
121 I.getIntrinsicID() == Intrinsic::amdgcn_s_cluster_barrier);
123 const GCNSubtarget &
ST = TM.
getSubtarget<GCNSubtarget>(*
I.getFunction());
124 bool IsSingleWaveWG =
false;
127 unsigned WGMaxSize =
ST.getFlatWorkGroupSizes(*
I.getFunction()).second;
128 IsSingleWaveWG = WGMaxSize <=
ST.getWavefrontSize();
135 if (
I.getIntrinsicID() == Intrinsic::amdgcn_s_cluster_barrier) {
138 if (IsSingleWaveWG) {
139 B.CreateIntrinsicWithoutFolding(
B.getVoidTy(),
140 Intrinsic::amdgcn_wave_barrier, {})
145 CallInst *IsFirst =
B.CreateIntrinsicWithoutFolding(
146 B.getInt1Ty(), Intrinsic::amdgcn_s_barrier_signal_isfirst,
149 B.CreateIntrinsicWithoutFolding(
150 B.getVoidTy(), Intrinsic::amdgcn_s_barrier_wait, {BarrierID_16})
155 B.SetInsertPoint(ThenTerm);
162 B.CreateIntrinsicWithoutFolding(
163 B.getVoidTy(), Intrinsic::amdgcn_s_barrier_signal, {BarrierID_32})
166 B.SetInsertPoint(&
I);
167 B.CreateIntrinsicWithoutFolding(
168 B.getVoidTy(), Intrinsic::amdgcn_s_barrier_wait, {BarrierID_16})
175 bool IsWorkgroupScope =
false;
177 if (
I.getIntrinsicID() == Intrinsic::amdgcn_s_barrier_wait ||
178 I.getIntrinsicID() == Intrinsic::amdgcn_s_barrier_signal ||
179 I.getIntrinsicID() == Intrinsic::amdgcn_s_barrier_signal_isfirst) {
185 IsWorkgroupScope =
true;
186 else if (
I.getIntrinsicID() == Intrinsic::amdgcn_s_barrier_signal_isfirst &&
188 I.getContext().diagnose(
189 DiagnosticInfoUnsupported(*
I.getFunction(),
190 "s_barrier_signal_isfirst does not support "
191 "user_cluster_barrier_id (-3)",
195 assert(
I.getIntrinsicID() == Intrinsic::amdgcn_s_barrier);
196 IsWorkgroupScope =
true;
199 if (IsWorkgroupScope && IsSingleWaveWG) {
201 if (
I.getIntrinsicID() == Intrinsic::amdgcn_s_barrier ||
202 I.getIntrinsicID() == Intrinsic::amdgcn_s_barrier_wait) {
203 B.CreateIntrinsicWithoutFolding(
B.getVoidTy(),
204 Intrinsic::amdgcn_wave_barrier, {})
206 }
else if (
I.getIntrinsicID() ==
207 Intrinsic::amdgcn_s_barrier_signal_isfirst) {
209 I.replaceAllUsesWith(
B.getInt1(
true));
215 if (
I.getIntrinsicID() == Intrinsic::amdgcn_s_barrier &&
216 ST.hasSplitBarriers()) {
220 B.CreateIntrinsicWithoutFolding(
221 B.getVoidTy(), Intrinsic::amdgcn_s_barrier_signal, {BarrierID_32})
223 B.CreateIntrinsicWithoutFolding(
224 B.getVoidTy(), Intrinsic::amdgcn_s_barrier_wait, {BarrierID_16})
233bool AMDGPULowerIntrinsicsImpl::visitPtrSBufferLoad(IntrinsicInst &
I) {
234 assert(
I.getIntrinsicID() == Intrinsic::amdgcn_ptr_s_buffer_load);
236 if (
I.hasMetadata(LLVMContext::MD_invariant_load))
239 I.setMetadata(LLVMContext::MD_invariant_load,
244bool AMDGPULowerIntrinsicsImpl::visitMonitorSleep(IntrinsicInst &
I) {
245 assert(
I.getIntrinsicID() == Intrinsic::amdgcn_s_monitor_sleep);
247 const GCNSubtarget &
ST = TM.
getSubtarget<GCNSubtarget>(*
I.getFunction());
248 if (!
ST.hasNoSleepForever())
252 if (!(Sleep & 0x8000))
256 Value *NewSleep =
B.getInt16(0x2000);
257 I.setArgOperand(0, NewSleep);
262bool AMDGPULowerIntrinsicsImpl::visitCvtScale(IntrinsicInst &
I) {
264 switch (
I.getIntrinsicID()) {
267 case Intrinsic::amdgcn_cvt_scale_pk8_f16_fp8:
268 case Intrinsic::amdgcn_cvt_scale_pk8_bf16_fp8:
269 case Intrinsic::amdgcn_cvt_scale_pk8_f16_bf8:
270 case Intrinsic::amdgcn_cvt_scale_pk8_bf16_bf8:
271 case Intrinsic::amdgcn_cvt_scale_pk8_f32_fp8:
272 case Intrinsic::amdgcn_cvt_scale_pk8_f32_bf8:
275 case Intrinsic::amdgcn_cvt_scale_pk8_f16_fp4:
276 case Intrinsic::amdgcn_cvt_scale_pk8_bf16_fp4:
277 case Intrinsic::amdgcn_cvt_scale_pk8_f32_fp4:
278 case Intrinsic::amdgcn_cvt_scale_pk16_f16_bf6:
279 case Intrinsic::amdgcn_cvt_scale_pk16_bf16_bf6:
280 case Intrinsic::amdgcn_cvt_scale_pk16_f16_fp6:
281 case Intrinsic::amdgcn_cvt_scale_pk16_bf16_fp6:
282 case Intrinsic::amdgcn_cvt_scale_pk16_f32_fp6:
283 case Intrinsic::amdgcn_cvt_scale_pk16_f32_bf6:
288 const GCNSubtarget &
ST = TM.
getSubtarget<GCNSubtarget>(*
I.getFunction());
289 if (
ST.hasBlock16ConversionScaleInsts())
293 if (ScaleSel < MaxSel)
296 I.getContext().diagnose(DiagnosticInfoUnsupported(
298 I.getCalledFunction()->getName() +
299 Twine(
" scale_sel maximum supported value is ") + Twine(MaxSel - 1),
307 AMDGPULowerIntrinsicsImpl Impl(M, TM);
313bool AMDGPULowerIntrinsicsLegacy::runOnModule(
Module &M) {
314 auto &TPC = getAnalysis<TargetPassConfig>();
317 AMDGPULowerIntrinsicsImpl Impl(M, TM);
321#define PASS_DESC "AMDGPU lower intrinsics"
328char AMDGPULowerIntrinsicsLegacy::ID = 0;
331 return new AMDGPULowerIntrinsicsLegacy;
assert(UImm &&(UImm !=~static_cast< T >(0)) &&"Invalid immediate!")
The AMDGPU TargetMachine interface definition for hw codegen targets.
static GCRegistry::Add< OcamlGC > B("ocaml", "ocaml 3.10-compatible GC")
AMD GCN specific subclass of TargetSubtarget.
uint64_t IntrinsicInst * II
ModuleAnalysisManager MAM
#define INITIALIZE_PASS_DEPENDENCY(depName)
#define INITIALIZE_PASS_END(passName, arg, name, cfg, analysis)
#define INITIALIZE_PASS_BEGIN(passName, arg, name, cfg, analysis)
static bool forEachCall(Function &Intrin, T Callback)
Represent the analysis usage information of a pass.
AnalysisUsage & addRequired()
LLVM_ABI void copyMetadata(const Instruction &SrcInst, ArrayRef< unsigned > WL=ArrayRef< unsigned >())
Copy metadata from SrcInst to this instruction.
A wrapper class for inspecting calls to intrinsic functions.
static MDTuple * get(LLVMContext &Context, ArrayRef< Metadata * > MDs)
ModulePass class - This class is used to implement unstructured interprocedural optimizations and ana...
A Module instance is used to store all the information related to an LLVM module.
A set of analyses that are preserved following a run of a transformation pass.
static PreservedAnalyses none()
Convenience factory function for the empty preserved set.
static PreservedAnalyses all()
Construct a special preserved set that preserves all passes.
CodeGenOptLevel getOptLevel() const
Returns the optimization level: None, Less, Default, or Aggressive.
const STC & getSubtarget(const Function &F) const
This method returns a pointer to the specified type of TargetSubtargetInfo.
Target-Independent Code Generator Pass Configuration Options.
iterator_range< user_iterator > users()
#define llvm_unreachable(msg)
Marks that the current location is not supposed to be reachable.
friend class Instruction
Iterator for Instructions in a `BasicBlock.
This is an optimization pass for GlobalISel generic memory operations.
decltype(auto) dyn_cast(const From &Val)
dyn_cast<X> - Return the argument parameter cast to the specified type.
iterator_range< early_inc_iterator_impl< detail::IterOfRange< RangeT > > > make_early_inc_range(RangeT &&Range)
Make a range that does early increment to allow mutation of the underlying range without disrupting i...
RelativeUniformCounterPtr ValuesPtrExpr VTableAddr Value
ModulePass * createAMDGPULowerIntrinsicsLegacyPass()
IRBuilder(LLVMContext &, FolderTy, InserterTy) -> IRBuilder< FolderTy, InserterTy >
decltype(auto) cast(const From &Val)
cast<X> - Return the argument parameter cast to the specified type.
LLVM_ABI Instruction * SplitBlockAndInsertIfThen(Value *Cond, BasicBlock::iterator SplitBefore, bool Unreachable, MDNode *BranchWeights=nullptr, DomTreeUpdater *DTU=nullptr, LoopInfo *LI=nullptr, BasicBlock *ThenBlock=nullptr)
Split the containing block at the specified instruction - everything before SplitBefore stays in the ...
AnalysisManager< Module > ModuleAnalysisManager
Convenience typedef for the Module analysis manager.
PreservedAnalyses run(Module &M, ModuleAnalysisManager &MAM)